Survival Analysis ด้วย Python
Shae Wang
Senior Data Scientist
ชื่อ DataFrame: battery_df
| Battery ID | Duration | Dead | Brand | Truck |
|---|---|---|---|---|
| 1 | 2.5 yrs | No | Brand A | Long |
| 2 | 6 yrs | Yes | Brand B | Short |
| 3 | 5 yrs | No | Brand B | Long |
| ... | ... | ... | ... | ... |
| 1000 | 4.5 yrs | Yes | Brand A | Short |
อายุการใช้งานเฉลี่ยของแบตเตอรี่คือเท่าไร?
np.average(battery_df["Duration"])


เมื่อทราบเวลาการอยู่รอดเพียงบางส่วน
Censorship เกิดขึ้นได้อย่างไร?

สถิติเชิงรวม
np.average(), max(), min()การถดถอย
$$S(t)=Pr(T>t)$$


จะระบุได้อย่างไรว่าข้อมูลจุดใดถูก censored?
ขั้นตอนที่ 1) ตรวจสอบคอลัมน์ censorship (มักถูกประมวลผลล่วงหน้าแล้ว)
ข้อมูลถูก censored มากเกินไปหรือไม่?
ขั้นตอนที่ 2) ตรวจสอบสัดส่วนของข้อมูลที่ถูก censored (ค่าอ้างอิงทั่วไปคือ 50%)
Censorship เป็นแบบ non-informative และสุ่มหรือไม่?
ขั้นตอนที่ 3) ตรวจสอบสาเหตุของ censorship เพื่อให้แน่ใจว่าการถูก censored ของข้อมูลไม่ส่งผลต่อการอยู่รอด
Survival Analysis ด้วย Python