การประเมินโมเดล

แนวคิด Generative AI

Daniel Tedesco

Data Lead, Google

ทำไมต้องประเมิน?

ประเมินประสิทธิภาพและความสามารถของโมเดล:

  • วัดความก้าวหน้า
  • เปรียบเทียบโมเดลอย่างเป็นระบบ
  • เทียบเคียงประสิทธิภาพของมนุษย์
แนวคิด Generative AI

การประเมิน AI เชิง generative

เมตริกเชิงปริมาณ

ตัวเลขที่แทนเมตริกเชิงปริมาณ

  • เมตริกประเมินโมเดล discriminative
  • เมตริกเฉพาะสำหรับโมเดล generative

เมตริกเชิงมนุษย์

ฟองสนทนา แทนเมตริกเชิงมนุษย์

  • เปรียบเทียบกับประสิทธิภาพของมนุษย์
  • การประเมินอย่างชาญฉลาด
แนวคิด Generative AI

เทคนิคประเมินโมเดล discriminative

วัดประสิทธิภาพบนงานที่มีคำนิยามชัดเจน

ข้อดี:

  • เป็นที่ยอมรับและเข้าใจอย่างกว้างขวาง
  • คำนวณและเปรียบเทียบได้ง่าย

ข้อเสีย:

  • ไม่ครอบคลุมลักษณะเชิงอัตวิสัยของเนื้อหาที่สร้างขึ้น

กระดานเป้าพร้อมลูกดอกใกล้จุดศูนย์กลาง

แนวคิด Generative AI

เมตริกเฉพาะสำหรับโมเดล generative

ปรับแต่งสำหรับงาน generative โดยเฉพาะ

ข้อดี:

  • เกณฑ์ละเอียด เช่น ความสมจริง ความหลากหลาย และความแปลกใหม่
  • มีเมตริกที่เป็นที่รู้จักหลายตัว

ข้อเสีย:

  • ไม่ครอบคลุมองค์ประกอบเชิงอัตวิสัยหลายด้าน
  • มักไม่สามารถนำไปใช้ทั่วไปได้

ภาพวาดวัว

แนวคิด Generative AI

การเปรียบเทียบกับประสิทธิภาพของมนุษย์

 

ข้อดี:

  • เทียบเคียงกับความสามารถของมนุษย์
  • แสดงให้เห็นความสามารถในการนำไปใช้จริง

ข้อเสีย:

  • การเปรียบเทียบอาจไม่เป็นธรรม

AI กำลังแข่งขันกับมนุษย์

แนวคิด Generative AI

AI ที่คว้ารางวัล

การแข่งขันกับมนุษย์

ผลงานศิลปะที่สร้างโดย AI ซึ่งได้รับรางวัล พร้อมริบบิ้นสีน้ำเงินแสดงความชนะ

การสอบมาตรฐานสำหรับมนุษย์

กราฟแสดงผลการทดสอบของ GPT-4 บนการสอบมาตรฐานหลายรายการ โดยทำได้ดีกว่านักศึกษาส่วนใหญ่ในการสอบชื่อดัง เช่น Uniform Bar Exam และ GRE

1 https://twitter.com/colostatefair/status/1565486317839863809, OpenAI
แนวคิด Generative AI

มาตรฐานทองคำ

การประเมินอย่างชาญฉลาดโดยมนุษย์หรือ AI อื่น

ข้อดี:

  • ครอบคลุมแง่มุมเชิงอัตวิสัย

ข้อเสีย:

  • ช้า ต้นทุนสูง และมาตรฐานยากจะกำหนด
  • ได้รับผลจากอคติและความไม่สม่ำเสมอของมนุษย์
แนวคิด Generative AI

การทดสอบ Turing

 

  • เสนอโดยนักวิทยาศาสตร์คอมพิวเตอร์ Alan Turing
  • มนุษย์ผู้ประเมินตัดสินเนื้อหาที่สร้างโดย AI
  • ผ่านการทดสอบหากผู้ประเมินไม่สามารถแยกแยะ AI จากมนุษย์ได้
  • แต่พฤติกรรมมนุษย์ไม่ใช่มาตรฐานที่ดีที่สุดเสมอไป

ภาพแสดงการทดสอบ Turing ประกอบด้วยผู้ประเมินที่เป็นมนุษย์ หน้าจอคอมพิวเตอร์แสดงเนื้อหาจาก AI และเนื้อหาที่สร้างโดยมนุษย์ เพื่อแสดงกระบวนการแยกแยะทั้งสอง

แนวคิด Generative AI

มาฝึกกันเถอะ!

แนวคิด Generative AI

Preparing Video For Download...