高品質回饋蒐集的方法

Reinforcement Learning from Human Feedback(RLHF)

Mina Parham

AI Engineer

高品質回饋蒐集的方法

去除獎勵模型的 RLHF 流程。

Reinforcement Learning from Human Feedback(RLHF)

高品質回饋蒐集的方法

完整的 RLHF 流程。

Reinforcement Learning from Human Feedback(RLHF)

成對比較

  • 二選一比較:
  • 優點:簡單、直覺,能降低偏誤
  • 挑戰:每個標註資訊量較少
  • 例子:電影 A vs. 電影 B:「你比較喜歡哪一部?」

一個人手持兩個牌子:一個為「接受」,一個為「拒絕」圖示。

Reinforcement Learning from Human Feedback(RLHF)

成對比較

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Reinforcement Learning from Human Feedback(RLHF)

評分

  • 以量表給分:

  • 優點:可提供更細緻的回饋

  • 挑戰:易受偏誤影響,量表不一致
  • 例子
      電影 A:4/5
      電影 B:3/5
    

一位女性手持星星,周圍有評分圖示的插圖。

Reinforcement Learning from Human Feedback(RLHF)

心理因素

  • 認知偏誤
    • 框架效應:問題的呈現方式會影響回答
    • 序位效應:選項出現的順序會影響決策
    • 錨定:先前資訊會牽動當下判斷

一個人用眼睛看到方形,但在腦中解讀成長方形,說明偏誤概念的圖片。

Reinforcement Learning from Human Feedback(RLHF)

蒐集高品質回饋的準則

 

  • 認知負荷:使用者疲勞,回饋不一致
  • 謹慎撰寫問題
    • 降低認知負荷帶來的風險。
  • 隨機化查詢順序
    • 盡量減少錨定與框架造成的偏誤。
  • 蒐集多元資料
    • 緩解雜訊問題。

一位男士與女士分析回饋與文字的圖片。

Reinforcement Learning from Human Feedback(RLHF)

一起來練習吧!

Reinforcement Learning from Human Feedback(RLHF)

Preparing Video For Download...