Pythonで学ぶSurvival Analysis
Shae Wang
Senior Data Scientist
イベント発生までの時間データの生存関数を推定するノンパラメトリック統計量。
定義:
生存関数 $S(t)$ の推定: $$S(t)=\prod_{i:t_i\leq t}\bigg(1-\frac{d_i}{n_i}\bigg)$$
イベントが 1, 2, 3 の3時点で発生するとする。
$t=2$ の生存率: $$S(t=2)=\bigg(1-\frac{d_1}{n_1}\bigg)*\bigg(1-\frac{d_2}{n_2}\bigg)$$
$t=3$ の生存率: $$S(t=3)=S(t=2)*\bigg(1-\frac{d_3}{n_3}\bigg)$$
時点 t の生存率は、t およびそれ以前各時点の生存確率の積に等しい。
from lifelines import KaplanMeierFitter
KaplanMeierFitter: lifelines ライブラリのクラス
kmf = KaplanMeierFitter()
kmf.fit(durations, event_observed)
DataFrame 名: mortgage_df
| id | duration | paid_off |
|---|---|---|
| 1 | 25 | 0 |
| 2 | 17 | 1 |
| 3 | 5 | 0 |
| ... | ... | ... |
| 100 | 30 | 1 |
DataFrame 名: mortgage_df
| id | duration | paid_off |
|---|---|---|
| 1 | 25 | 0 |
| 2 | 17 | 1 |
| 3 | 5 | 0 |
| ... | ... | ... |
| 100 | 30 | 1 |
from lifelines import KaplanMeierFitter
mortgage_kmf = KaplanMeierFitter()
mortgage_kmf.fit(duration=mortgage_df["duration"],
event_observed=mortgage_df["paid_off"])
<lifelines.KaplanMeierFitter:"KM_estimate",
fitted with 100 total observations,
18 right-censored observations>
未返済ローンの中央値は?
print(mortgage_kmf.median_survival_time_)
4.0
開始後、各年にローンが未返済である確率は?
print(mortgage_kmf.survival_function_)
KM_estimate
timeline
0.0 1.000000
1.0 0.983267
2.0 0.950933
3.0 0.892328
開始後34年時点で未返済である確率は?
mortgage_kmf.predict(34)
0.037998
.median_survival_time_ は計算不可。Pythonで学ぶSurvival Analysis