Python में Survival Analysis
Shae Wang
Senior Data Scientist
DataFrame नाम: battery_df
| Battery ID | Duration | Dead | Brand | Truck |
|---|---|---|---|---|
| 1 | 2.5 yrs | No | Brand A | Long |
| 2 | 6 yrs | Yes | Brand B | Short |
| 3 | 5 yrs | No | Brand B | Long |
| ... | ... | ... | ... | ... |
| 1000 | 4.5 yrs | Yes | Brand A | Short |
औसत बैटरी जीवन कितना है?
np.average(battery_df["Duration"])


जब survival time आंशिक रूप से ही ज्ञात हो.
सेंसरशिप कैसे होती है?

Aggregated statistics
np.average(), max(), min().Regression
$$S(t)=Pr(T>t)$$


क्या हम पहचान सकते हैं कि कौन-से डेटा पॉइंट censored हैं?
चरण 1) सेंसरशिप कॉलम देखें (अक्सर preprocessed होते हैं).
क्या बहुत अधिक डेटा censored है?
चरण 2) censored डेटा पॉइंट्स का अनुपात जाँचें (thumb rule: 50%).
क्या सेंसरशिप non-informative और random है?
चरण 3) सेंसरशिप के कारण जाँचें ताकि यह सुनिश्चित हो कि किसी पॉइंट का censored होना, survival को प्रभावित न करे.
Python में Survival Analysis