Pythonで学ぶSurvival Analysis
Shae Wang
Senior Data Scientist
さまざまな結果の確率を表す数学関数。

さまざまな結果の確率を表す数学関数。

連続型の確率分布で、時間-事象データのモデル化に適する(元は粒度分布のモデル化に適用)。
$$f(x;\lambda,k)=\frac{k}{\lambda}\bigg(\frac{x}{\lambda}\bigg)^{k-1}e^{-(x/\lambda)^k}$$ $$x\geq0,k>0,\lambda>0$$
形状を決める

尺度を決める

ある企業は故障しやすい機械群を保守しています…

ある企業は故障しやすい機械群を保守しています…

$$f(x;\lambda,k)=\frac{k}{\lambda}\bigg(\frac{x}{\lambda}\bigg)^{k-1}e^{-(x/\lambda)^k} \quad\rightarrow\quad\qquad\qquad S(t)=e^{-(t/\lambda)^\rho}$$

$\rho$ は k と同じ
$$f(x;\lambda,k)=\frac{k}{\lambda}\bigg(\frac{x}{\lambda}\bigg)^{k-1}e^{-(x/\lambda)^k} \quad\rightarrow\quad f(x;\lambda,k=3)=\frac{3}{\lambda}\bigg(\frac{x}{\lambda}\bigg)^2e^{-(x/\lambda)^3}$$



WeibullFitter クラスをインポートfrom lifelines import WeibullFitter
WeibullFitter を生成wb = WeibullFitter()
.fit() でデータに当てはめwb.fit(durations, event_observed)
.survival_function_, .lambda_, .rho_, .summary, .predict() を参照DataFrame 名: mortgage_df
| id | duration | paid_off |
|---|---|---|
| 1 | 25 | 0 |
| 2 | 17 | 1 |
| 3 | 5 | 0 |
| ... | ... | ... |
| 1000 | 30 | 1 |
from lifelines import WeibullFitter
wb = WeibullFitter()
wb.fit(durations=mortgage_df["duration"],
event_observed=mortgage_df["paid_off"])
wb.survival_function_.plot()
plt.show()

print(wb.lambda_, wb.rho_)
6.11 0.94
print(wb.predict(20))
0.05
Pythonで学ぶSurvival Analysis