แนวปฏิบัติที่ดีสำหรับการตรวจสอบข้อมูล

การจัดการข้อมูล AI อย่างรับผิดชอบ

Maria Prokofieva

Lead ML engineer

หัวข้อที่จะเรียน

  • การวิเคราะห์กลุ่มย่อย
  • ค่าที่หายไป
  • การกำจัด Outlier
  • การแก้ไขความไม่สอดคล้องของข้อมูล
  • Feature Scaling
  • Feature Encoding
  • การลดมิติข้อมูล
การจัดการข้อมูล AI อย่างรับผิดชอบ

การวิเคราะห์กลุ่มย่อย

ขั้นตอนที่ 1: แบ่งกลุ่มตามลักษณะที่ได้รับการคุ้มครอง

ขั้นตอนที่ 2: ประเมินการกระจายทางสถิติและประสิทธิภาพของโมเดลในแต่ละกลุ่มย่อย

ขั้นตอนที่ 3: ประเมิน Fairness Metrics ของโมเดลสำหรับแต่ละกลุ่มย่อย

ขั้นตอนที่ 4: ใช้กลยุทธ์ลดความลำเอียง

การจัดการข้อมูล AI อย่างรับผิดชอบ

ข้อมูลที่หายไป

  • พบบ่อยในชุดข้อมูลขนาดใหญ่
  • การลบข้อมูล
  • กลยุทธ์การ Imputation และวิธีอิงโมเดล
  • การวิเคราะห์กลุ่มย่อยเพื่อตรวจสอบ

ข้อมูลที่หายไป

การจัดการข้อมูล AI อย่างรับผิดชอบ

การกำจัด Outlier

  • วิธีทางสถิติ เช่น z-score, IQR หรือ Robust Scaling
  • ตรวจสอบความเป็นธรรมในการจัดการข้อมูลแต่ละกลุ่ม

การกำจัด Outlier

การจัดการข้อมูล AI อย่างรับผิดชอบ

ความไม่สอดคล้องของข้อมูล

  • คุณภาพข้อมูลส่งผลต่อความถูกต้องและความน่าเชื่อถือของโมเดล
  • การกำหนดมาตรฐานและกฎการตรวจสอบข้อมูล
  • การ Normalization ระดับกลุ่มย่อย
การจัดการข้อมูล AI อย่างรับผิดชอบ

Feature Scaling

  • Feature Scaling สำหรับแปลง Feature ที่ใช้เป็น Input
  • ตรวจสอบโดยดูการกระจายของข้อมูลในแต่ละกลุ่ม

Feature Scaling

การจัดการข้อมูล AI อย่างรับผิดชอบ

Feature Encoding

  • ประเมินผลกระทบของ Encoding ต่อผลลัพธ์
  • ตรวจสอบความลำเอียงและการสูญเสียข้อมูล
  • ตรวจสอบการ Overfit
  • ใช้ Regularization และการลดมิติข้อมูล
การจัดการข้อมูล AI อย่างรับผิดชอบ

การลดมิติข้อมูล

  • ลด Feature และคงข้อมูลสำคัญไว้
  • อาจก่อให้เกิดความลำเอียง
  • ใช้เทคนิคที่คำนึงถึงความเป็นธรรม เช่น t-SNE

การลดมิติข้อมูล

การจัดการข้อมูล AI อย่างรับผิดชอบ

ที่ปรึกษาทางการเงิน

  • Feature "รายได้ต่อปี" และ "ความถี่ในการลงทุน"
  • ปรับ Outlier และทำ Scaling
  • การวิเคราะห์กลุ่มย่อย

การกำจัด Outlier

การจัดการข้อมูล AI อย่างรับผิดชอบ

มาฝึกกันเถอะ!

การจัดการข้อมูล AI อย่างรับผิดชอบ

Preparing Video For Download...