วิธีการรวบรวม Feedback คุณภาพสูง

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

วิธีการรวบรวม Feedback คุณภาพสูง

กระบวนการ RLHF โดยไม่มี Reward Model

Reinforcement Learning from Human Feedback (RLHF)

วิธีการรวบรวม Feedback คุณภาพสูง

กระบวนการ RLHF แบบครบถ้วน

Reinforcement Learning from Human Feedback (RLHF)

การเปรียบเทียบแบบคู่

  • การเลือกระหว่างสองตัวเลือก:
  • ข้อดี: เข้าใจง่าย ลดอคติได้ดี
  • ความท้าทาย: ให้ข้อมูลต่อ Label น้อยกว่า
  • ตัวอย่าง: หนัง A กับหนัง B: "คุณชอบเรื่องไหนมากกว่า?

ชายคนหนึ่งถือป้ายสองใบ ใบหนึ่งมีไอคอน 'Accepted' และอีกใบมีไอคอน 'Rejected'

Reinforcement Learning from Human Feedback (RLHF)

การเปรียบเทียบแบบคู่

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Reinforcement Learning from Human Feedback (RLHF)

การให้คะแนน

  • การให้คะแนนบนสเกลที่กำหนด:

  • ข้อดี: ให้ Feedback ที่ละเอียดมากขึ้น

  • ความท้าทาย: เกิดอคติได้ง่าย สเกลไม่สอดคล้องกัน
  • ตัวอย่าง:
      หนัง A: 4/5
      หนัง B: 3/5
    

ภาพประกอบของผู้หญิงถือดาว พร้อมไอคอนแสดงการให้คะแนนรอบตัว

Reinforcement Learning from Human Feedback (RLHF)

ปัจจัยทางจิตวิทยา

  • อคติทางการรับรู้:
    • Framing Effect: วิธีนำเสนอคำถามส่งผลต่อคำตอบได้
    • Serial Position Effect: ลำดับของตัวเลือกส่งผลต่อการตัดสินใจ
    • Anchoring: ข้อมูลก่อนหน้าทำให้การตัดสินใจเบี่ยงเบน

ภาพบุคคลมองเห็นสี่เหลี่ยมจัตุรัส แต่ตีความในใจว่าเป็นสี่เหลี่ยมผืนผ้า แสดงถึงแนวคิดเรื่องอคติ

Reinforcement Learning from Human Feedback (RLHF)

แนวทางการรวบรวม Feedback คุณภาพสูง

 

  • Cognitive load: ผู้ใช้ที่เหนื่อยล้า ทำให้ Feedback ไม่สม่ำเสมอ
  • ร่างคำถามอย่างรอบคอบ
    • เพื่อลดความเสี่ยงจาก Cognitive load
  • สุ่มลำดับคำถาม
    • เพื่อลดอคติจาก Anchoring และ Framing
  • รวบรวมข้อมูลที่หลากหลาย
    • เพื่อลดผลกระทบจาก Noise

ภาพชายและหญิงกำลังวิเคราะห์ Feedback และข้อความต่าง ๆ

Reinforcement Learning from Human Feedback (RLHF)

มาฝึกกันเถอะ!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...