การนำแหล่งข้อมูลป้อนกลับที่หลากหลายมาใช้

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

การ Generalize ของโมเดลที่ดีขึ้น

 

  • แสดงมุมมองและบริบทที่แตกต่างกัน
  • ทำให้โมเดลเข้าใจค่านิยมและความต้องการได้กว้างขึ้น

ภาพมือพร้อมฟองคำพูดที่แสดงถึงความคิดเห็นที่หลากหลาย

Reinforcement Learning from Human Feedback (RLHF)

การลดอคติ

  • ลดอคติส่วนบุคคล
  • ทำให้ผลลัพธ์ของโมเดลสมดุลและเป็นธรรมมากขึ้น

แผนภูมิแท่งแสดงความแตกต่างระหว่างชุดข้อมูลที่มีอคติต่อกลุ่มชายและชุดข้อมูลที่สมดุลระหว่างชายและหญิง

Reinforcement Learning from Human Feedback (RLHF)

ความสอดคล้องกับค่านิยมของมนุษย์ที่ดีขึ้น

  • ความต้องการของมนุษย์ที่ซับซ้อน
  • ครอบคลุมวัฒนธรรมและภูมิหลังที่หลากหลาย

ไอคอนแสดงกลุ่มคนที่หลากหลาย

Reinforcement Learning from Human Feedback (RLHF)

การปรับตัวที่ดีขึ้น

  • โมเดลตอบสนองต่อความต้องการและความชอบของผู้ใช้ที่หลากหลายขึ้น
  • ครอบคลุมมุมมองที่แตกต่างกัน

ไอคอนแสดงบุคคลพร้อม Emoji ที่สื่อถึงมุมมองที่แตกต่างกัน

Reinforcement Learning from Human Feedback (RLHF)

ความแข็งแกร่งที่เพิ่มขึ้น

  • ทนทานต่อ Input ประเภทต่าง ๆ
  • ช่วยเพิ่มประสิทธิภาพของโมเดล

ไดอะแกรมแสดงคุณภาพที่ดีขึ้นจาก Input และบริบทที่หลากหลาย

Reinforcement Learning from Human Feedback (RLHF)

การรวมข้อมูล Preference จากหลายแหล่ง

ข้อมูล Preference preference_df จากแหล่ง 'Journalist', 'Social Media Influencer' และ 'Marketing Professional':

ตารางแสดงข้อมูลเชิงโครงสร้างจากสามแหล่งที่มาต่างกัน

Reinforcement Learning from Human Feedback (RLHF)

Majority Voting

รวมข้อมูลตัวอย่างนี้โดย Group ตาม 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

จากนั้นใช้ Majority Voting:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

แหล่งข้อมูล Preference ที่ไม่น่าเชื่อถือ

ข้อมูล Preference preference_df2 จากผู้เชี่ยวชาญสามคนเดิม:

ตารางแสดงข้อมูลเชิงโครงสร้างจากสามแหล่งที่มาต่างกัน

Reinforcement Learning from Human Feedback (RLHF)

แหล่งข้อมูล Preference ที่ไม่น่าเชื่อถือ

  • วน Loop ผ่านแถวของ preference_df2 เพื่อระบุแหล่งที่ไม่น่าเชื่อถือ:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

มาฝึกกันเถอะ!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...