高品質なフィードバック収集の方法

人間のフィードバックによる強化学習(RLHF)

Mina Parham

AI Engineer

高品質なフィードバック収集の方法

報酬モデルを除くRLHFのプロセス。

人間のフィードバックによる強化学習(RLHF)

高品質なフィードバック収集の方法

RLHFの全プロセス。

人間のフィードバックによる強化学習(RLHF)

ペア比較

  • 2つの選択肢から選ぶ:
  • 利点: シンプル、直感的、バイアス低減
  • 課題: ラベル当たりの情報量が少ない
  • : 映画A vs. 映画B: 「どちらが好みですか?」

「承認」と「却下」のアイコンがある2枚の札を手に持つ人。

人間のフィードバックによる強化学習(RLHF)

ペア比較

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
人間のフィードバックによる強化学習(RLHF)

レーティング

  • スケールでのスコア付け:

  • 利点: より詳細なフィードバック

  • 課題: バイアスの影響、尺度の不一致
  • :
      映画A: 4/5
      映画B: 3/5
    

女性が星を持ち、周囲に評価アイコンがあるイラスト。

人間のフィードバックによる強化学習(RLHF)

心理的要因

  • 認知バイアス:
    • フレーミング効果: 質問の提示方法で回答が変わる
    • 系列位置効果: 選択肢の提示順で判断が変わる
    • アンカリング: 先行情報が現在の判断を偏らせる

目では正方形を見ているが頭では長方形と解釈している人の図。バイアスの概念を表す。

人間のフィードバックによる強化学習(RLHF)

高品質なフィードバック収集の指針

 

  • 認知負荷: ユーザーの疲労で不一致なフィードバックに
  • 質問は慎重に設計
    • 認知負荷によるリスクを抑えるため
  • 質問順をランダム化
    • アンカリングやフレーミングの偏りを最小化
  • 多様なデータを収集
    • ノイズの影響を軽減

男女がフィードバックやテキストを分析している写真。

人間のフィードバックによる強化学習(RLHF)

Ayo berlatih!

人間のフィードバックによる強化学習(RLHF)

Preparing Video For Download...