การประเมินประสิทธิภาพของโมเดล

การวิเคราะห์เชิงพยากรณ์โดยใช้ข้อมูลเครือข่ายใน R

María Óskarsdóttir, Ph.D.

Post-doctoral researcher

การทำนายผล

library(pROC)
  • Logistic regression
logPredictions <- predict(logModel, newdata = test_set, type = "response")
  • Random forest
rfPredictions<- predict(rfModel, newdata = test_set, type='prob')
rfPredictions
attr(,"class")
      0     1
C 0.136 0.864
"matrix" "votes"
การวิเคราะห์เชิงพยากรณ์โดยใช้ข้อมูลเครือข่ายใน R

AUC

  • ความน่าจะเป็นที่ลูกค้าที่ยกเลิกบริการจะได้คะแนนสูงกว่าลูกค้าที่ไม่ยกเลิก
  • แสดง trade-off ระหว่าง sensitivity และ specificity ของโมเดล
  • ค่าอยู่ระหว่าง:
    • 0.5: โมเดลแบบสุ่ม
    • 1: โมเดลที่สมบูรณ์แบบ
library(pROC)
auc(test_set$label, logPredictions)
การวิเคราะห์เชิงพยากรณ์โดยใช้ข้อมูลเครือข่ายใน R

Top decile lift

  • วัดว่าโมเดลระบุลูกค้าที่ยกเลิกบริการได้ดีกว่าการสุ่มเลือกแค่ไหน
  • คำนวณสัดส่วนของลูกค้าที่ยกเลิกบริการจริงในกลุ่ม 10% ที่มีความน่าจะเป็นสูงสุด
  • ค่า Lift มากกว่า 1 หมายความว่าโมเดลดีกว่าการสุ่ม
  • หากใน 10% แรกของคะแนนสูงสุดมีลูกค้าที่ยกเลิกบริการ 60% และในประชากรทั้งหมดมี 10% ค่า lift คือ $60/10=6$
library(lift)
TopDecileLift(test_set$label, predictions, plot=TRUE)
การวิเคราะห์เชิงพยากรณ์โดยใช้ข้อมูลเครือข่ายใน R

มาฝึกกันเถอะ!

การวิเคราะห์เชิงพยากรณ์โดยใช้ข้อมูลเครือข่ายใน R

Preparing Video For Download...