ข้อกังวลและข้อพิจารณาด้านข้อมูล

แนวคิดของ Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

ข้อพิจารณาด้านข้อมูล

 

ข้อพิจารณาด้านข้อมูล

 

  • ปริมาณข้อมูลและพลังประมวลผล
  • คุณภาพข้อมูล
  • การติดป้ายกำกับ
  • ความลำเอียง
  • ความเป็นส่วนตัว
แนวคิดของ Large Language Models (LLMs)

ปริมาณข้อมูลและพลังประมวลผล

  • LLM ต้องใช้ข้อมูลจำนวนมาก
    • คล้ายกับเด็กที่กำลังเรียนรู้การพูด
    • 570 GB, ~1.3 ล้านเล่ม

 

เด็กกำลังเรียนรู้การพูด

1 Freepik
แนวคิดของ Large Language Models (LLMs)

ปริมาณข้อมูลและพลังประมวลผล

  • LLM ต้องใช้ข้อมูลจำนวนมาก
    • คล้ายกับเด็กที่กำลังเรียนรู้การพูด
    • 570 GB, ~1.3 ล้านเล่ม

 

  • ต้องใช้พลังประมวลผลสูง และใช้พลังงานมาก

 

  • อาจมีค่าใช้จ่ายสูงถึงหลายล้านดอลลาร์!

ชายกำลังทำงานบนคอมพิวเตอร์ที่เชื่อมต่อกับเซิร์ฟเวอร์ขนาดใหญ่

แนวคิดของ Large Language Models (LLMs)

คุณภาพข้อมูล

  • ข้อมูลที่มีคุณภาพเป็นสิ่งสำคัญ

 

  • ข้อมูลที่ถูกต้อง = เรียนรู้ได้ดีขึ้น = ผลลัพธ์ดีขึ้น = เพิ่มความน่าเชื่อถือ

 

  • เปรียบเหมือนเด็กเรียนรู้การพูด
    • ป้อนข้อมูลไร้สาระ -> ผลลัพธ์ก็ไร้สาระ

ผลลัพธ์คุณภาพต่ำหากฝึก LLM ด้วยข้อมูลที่มีข้อผิดพลาดหรือไวยากรณ์ที่ไม่ถูกต้อง

แนวคิดของ Large Language Models (LLMs)

ข้อมูลที่มีป้ายกำกับ

  • ป้ายกำกับที่ถูกต้อง: เรียนรู้แม่นยำ จดจำรูปแบบได้ ตอบสนองได้ถูกต้อง

  • ใช้แรงงานมาก: ต้องกำหนดป้ายกำกับให้แต่ละบทความ

ทีมงานกำลังติดป้ายกำกับข้อมูลบนคอมพิวเตอร์

  • ป้ายกำกับที่ผิดพลาดส่งผลต่อประสิทธิภาพโมเดล
  • แก้ไขข้อผิดพลาด: ระบุ -> วิเคราะห์ -> ปรับปรุง
แนวคิดของ Large Language Models (LLMs)

ความลำเอียงในข้อมูล

  • ได้รับอิทธิพลจากอคติในสังคม
  • ข้อมูลฝึกสอนขาดความหลากหลาย
  • นำไปสู่การเลือกปฏิบัติและผลลัพธ์ที่ไม่เป็นธรรม

 

  • ตรวจหาและจัดการข้อมูลที่มีความลำเอียง
    • ประเมินความไม่สมดุลของข้อมูล
    • ส่งเสริมความหลากหลาย
    • เทคนิคลดความลำเอียง: เพิ่มตัวอย่างที่หลากหลาย

ความลำเอียงในข้อมูล

  • ตัวอย่าง:

    • "The nurse said that..." -> "she" หรือ "her"
แนวคิดของ Large Language Models (LLMs)

ความเป็นส่วนตัวของข้อมูล

  • การปฏิบัติตามกฎหมายคุ้มครองข้อมูลและความเป็นส่วนตัว

 

  • ความเป็นส่วนตัวเป็นเรื่องสำคัญ
    • การฝึกโมเดลด้วยข้อมูลโดยไม่ได้รับอนุญาตอาจนำไปสู่การละเมิด
    • เกิดความเสียหายทางกฎหมาย การเงิน และชื่อเสียง
  • ข้อมูลที่ละเอียดอ่อนหรือข้อมูลส่วนบุคคล (PII)

 

  • ขอรับอนุญาตก่อนใช้งาน

ความเป็นส่วนตัวของข้อมูล

แนวคิดของ Large Language Models (LLMs)

มาฝึกกันเถอะ!

แนวคิดของ Large Language Models (LLMs)

Preparing Video For Download...