高质量反馈收集的方法

来自人类反馈的强化学习(RLHF)

Mina Parham

AI Engineer

高质量反馈收集的方法

不含奖励模型的RLHF流程。

来自人类反馈的强化学习(RLHF)

高质量反馈收集的方法

完整的RLHF流程。

来自人类反馈的强化学习(RLHF)

成对比较

  • 在两选项间做选择:
  • 优点:简单直观,降低偏差
  • 挑战:每个标签信息量较少
  • 示例:电影A vs. 电影B:"您更喜欢哪一个?"

一人手持两块牌:一块为"接受"图标,一块为"拒绝"图标。

来自人类反馈的强化学习(RLHF)

成对比较

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
来自人类反馈的强化学习(RLHF)

评分

  • 在量表上打分:

  • 优点:反馈更细致

  • 挑战:易受偏见影响,量表不一致
  • 示例
      电影A:4/5
      电影B:3/5
    

一位女性手持星星,周围有评分图标的插图。

来自人类反馈的强化学习(RLHF)

心理因素

  • 认知偏差
    • 框架效应:问题的呈现方式会影响回答
    • 系列位置效应:选项顺序会影响决策
    • 锚定效应:先前信息会偏置当前决策

一个人眼睛看到正方形,但在脑中解读为长方形,说明偏差概念的图片。

来自人类反馈的强化学习(RLHF)

高质量反馈收集指南

 

  • 认知负荷:用户疲劳,反馈不一致
  • 谨慎措辞问题
    • 以降低认知负荷带来的风险。
  • 随机化问题顺序
    • 以减少锚定与框架偏差。
  • 收集多样数据
    • 以缓解噪声问题。

一男一女在分析反馈与文本的图片。

来自人类反馈的强化学习(RLHF)

¡Vamos a practicar!

来自人类反馈的强化学习(RLHF)

Preparing Video For Download...