Python 中的生存分析
Shae Wang
Senior Data Scientist
数据框名称:battery_df
| 电池ID | 时长 | 死亡 | 品牌 | 车型 |
|---|---|---|---|---|
| 1 | 2.5 年 | 否 | 品牌A | 长轴 |
| 2 | 6 年 | 是 | 品牌B | 短轴 |
| 3 | 5 年 | 否 | 品牌B | 长轴 |
| ... | ... | ... | ... | ... |
| 1000 | 4.5 年 | 是 | 品牌A | 短轴 |
电池平均寿命是多少?
np.average(battery_df["Duration"])


当仅部分知道生存时间。
删失如何产生?

汇总统计
np.average(), max(), min()。回归
$$S(t)=Pr(T>t)$$


能否识别哪些数据点被删失?
步骤1)检查删失标记列(常已预处理)。
删失是否过多?
步骤2)检查删失数据占比(经验值为50%)。
删失是否非信息性且随机?
步骤3)调查删失原因,确保删失与生存无关。
Python 中的生存分析