การจัดลำดับความสำคัญของโมเดล

Demystifying Decision Science

Howard Friedman

Adjunct Professor at Columbia University

เริ่มต้นด้วย Linear Regression

  • มีประสิทธิภาพสำหรับผลลัพธ์ต่อเนื่องเมื่อข้อสมมติเป็นจริง
  • พิสูจน์แล้วกว่า 200 ปีว่าใช้งานได้จริง

ความเรียบง่ายมีพลัง

  • Linear regression หาเส้นที่พอดีที่สุดกับข้อมูล
  • ด้วยการแปลงข้อมูล ยังสามารถจำลองความสัมพันธ์แบบไม่เชิงเส้นได้

การตีความได้คือจุดแข็ง

  • ค่าสัมประสิทธิ์ช่วยในการสื่อสารผล
  • คำนวณเร็ว อธิบายง่าย
     

linear.png

Demystifying Decision Science

Logistic Regression

ปัญหาในโลกจริงหลายอย่างเกี่ยวข้องกับการพยากรณ์แบบทวิภาคหรือหมวดหมู่:

  • การตรวจจับการทุจริต การพยากรณ์การเลิกใช้บริการ และโมเดลความเสี่ยงด้านสุขภาพ

coinflip.png

Logistic regression มีความยืดหยุ่นสูง

  • เหมาะกับผลลัพธ์แบบทวิภาค หลายหมวดหมู่ หรือแบบมีลำดับ

ค่าความน่าจะเป็นช่วยสนับสนุนการตัดสินใจ

ตีความและนำไปใช้ได้ง่าย

  • ค่าสัมประสิทธิ์แสดงให้เห็นว่าแต่ละ feature ส่งผลต่อผลลัพธ์อย่างไร
  • เหมาะเป็น baseline สำหรับ classifier ที่ซับซ้อนกว่า
Demystifying Decision Science

การแปลง Feature

เริ่มต้นด้วยโมเดล baseline ที่แข็งแกร่ง

  • สร้างเวอร์ชันที่ใช้งานได้ก่อน แล้วค่อยประเมินคุณค่าของโมเดลที่ซับซ้อนขึ้น

การแปลง feature ช่วยเพิ่มประสิทธิภาพได้

  • การแปลงอย่าง log หรือกำลังสองช่วยเพิ่ม variance ที่อธิบายได้
  • ยังช่วยให้โมเดล fit กับข้อมูลได้ดีขึ้นด้วย

จับคู่ข้อสมมติของโมเดลกับข้อมูล

  • บางโมเดล เช่น linear regression ทำงานได้ดีที่สุดเมื่อค่าคงเหลือมีการแจกแจงแบบปกติ

  toolbox.png

Demystifying Decision Science

การแปลงข้อมูลที่ใช้บ่อย

 

  • Log และ square root ช่วยบีบช่วงข้อมูลกว้างและลดผลกระทบของค่าผิดปกติ
  • Standardization และ normalization ปรับ feature ให้อยู่ในช่วงที่ใกล้เคียงกัน มีประโยชน์มากเมื่อหน่วยต่างกัน
  • Polynomial terms เช่น ยกกำลังสองและกำลังสาม ช่วยแสดงความสัมพันธ์แบบไม่เชิงเส้นที่ซับซ้อนได้โดยไม่ยุ่งยาก

 

ใช้การแปลงข้อมูลเพื่อปรับปรุงโมเดลเริ่มต้นก่อนที่จะไปใช้โมเดลที่ซับซ้อนกว่า

 

transform.png

Demystifying Decision Science

มาฝึกกันเถอะ!

Demystifying Decision Science

Preparing Video For Download...