多様なフィードバック源の取り込み

人間のフィードバックによる強化学習(RLHF)

Mina Parham

AI Engineer

汎化の改善

 

  • 多様な視点と文脈を反映
  • 選好や価値を一般化

多様な意見を示す吹き出しと手の画像

人間のフィードバックによる強化学習(RLHF)

バイアスの低減

  • 個人のバイアスを軽減
  • 出力をよりバランスよく公平に

男性に偏ったデータセットと、男女が均等なバランスのデータセットを比較する棒グラフ

人間のフィードバックによる強化学習(RLHF)

人間の価値観との整合性向上

  • 複雑な人間の選好
  • 文化や背景を反映

多様な人々を表すアイコン

人間のフィードバックによる強化学習(RLHF)

適応性の向上

  • 幅広いニーズと嗜好に対応
  • 異なる視点を反映

人物と、異なる視点を示す絵文字のアイコン

人間のフィードバックによる強化学習(RLHF)

堅牢性の向上

  • 多様な入力に強い
  • パフォーマンスが向上

多様な入力と文脈で品質が向上することを示す図

人間のフィードバックによる強化学習(RLHF)

複数ソースの選好データ統合

ソースが「Journalist」「Social Media Influencer」「Marketing Professional」の選好データ preference_df:

3つの異なるソースからの構造化データの表

人間のフィードバックによる強化学習(RLHF)

多数決

このサンプルは'id'でグループ化して容易に統合可能:

df_majority = preference_df.groupby(['id']).apply(majority_vote)

次に多数決を適用:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
人間のフィードバックによる強化学習(RLHF)

信頼性の低い選好データ源

同じ3名の専門家による選好データ preference_df2:

3つの異なるソースからの構造化データの表

人間のフィードバックによる強化学習(RLHF)

信頼性の低い選好データ源

  • preference_df2の各行を走査して信頼性の低いソースを特定:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
人間のフィードバックによる強化学習(RLHF)

Passons à la pratique !

人間のフィードバックによる強化学習(RLHF)

Preparing Video For Download...