Kết hợp đa dạng nguồn phản hồi

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Cải thiện khả năng khái quát hóa của mô hình

 

  • Đại diện nhiều quan điểm và ngữ cảnh
  • Khái quát hóa sở thích và giá trị

Hình ảnh các bàn tay với các bong bóng thoại thể hiện ý kiến đa dạng.

Reinforcement Learning from Human Feedback (RLHF)

Giảm thiên lệch

  • Giảm thiên lệch cá nhân
  • Tạo đầu ra mô hình cân bằng và công bằng hơn

Biểu đồ cột cho thấy sự khác biệt giữa bộ dữ liệu thiên về nam và bộ dữ liệu cân bằng phân bố nam và nữ

Reinforcement Learning from Human Feedback (RLHF)

Phù hợp hơn với các giá trị của con người

  • Sở thích con người phức tạp
  • Đại diện văn hóa và bối cảnh đa dạng

Biểu tượng đại diện một nhóm người đa dạng

Reinforcement Learning from Human Feedback (RLHF)

Tăng khả năng thích ứng

  • Mô hình đáp ứng nhiều nhu cầu và sở thích hơn
  • Đại diện nhiều quan điểm

Biểu tượng một người với các emoji thể hiện các quan điểm khác nhau.

Reinforcement Learning from Human Feedback (RLHF)

Tăng độ vững chắc

  • Chống chịu với nhiều loại đầu vào
  • Cải thiện hiệu năng

Sơ đồ cho thấy chất lượng được cải thiện nhờ các đầu vào và ngữ cảnh khác nhau.

Reinforcement Learning from Human Feedback (RLHF)

Tích hợp dữ liệu sở thích từ nhiều nguồn

Dữ liệu sở thích preference_df với nguồn 'Journalist', 'Social Media Influencer', và 'Marketing Professional':

Bảng hiển thị dữ liệu có cấu trúc từ ba nguồn khác nhau

Reinforcement Learning from Human Feedback (RLHF)

Bỏ phiếu đa số

Mẫu dữ liệu này có thể tích hợp dễ dàng bằng cách nhóm theo 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Sau đó dùng bỏ phiếu đa số:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

Nguồn dữ liệu sở thích không đáng tin cậy

Dữ liệu sở thích preference_df2 với cùng ba chuyên gia:

Bảng hiển thị dữ liệu có cấu trúc từ ba nguồn khác nhau

Reinforcement Learning from Human Feedback (RLHF)

Nguồn dữ liệu sở thích không đáng tin cậy

  • Lặp qua các hàng của preference_df2 để nhận diện nguồn không đáng tin cậy:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

Ayo berlatih!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...