整合多元反馈来源

来自人类反馈的强化学习(RLHF)

Mina Parham

AI Engineer

提升模型泛化能力

 

  • 涵盖不同观点与情境
  • 更好地泛化偏好与价值

多只手与不同对话气泡,代表多元观点。

来自人类反馈的强化学习(RLHF)

降低偏见

  • 减轻个体偏见
  • 使模型输出更均衡、更公平

一个柱状图,展示偏向男性的数据集与男女均衡分布的数据集的差异

来自人类反馈的强化学习(RLHF)

更好地对齐人类价值观

  • 反映复杂的人类偏好
  • 呈现多元文化与背景

代表多元人群的图标

来自人类反馈的强化学习(RLHF)

更强的适应性

  • 覆盖更广的用户需求与偏好
  • 展示不同观点

一个人物图标,带有表示不同观点的表情符号。

来自人类反馈的强化学习(RLHF)

更高的鲁棒性

  • 对多种输入更具韧性
  • 提升模型性能

一个图示,展示因不同输入和情境而提升的质量。

来自人类反馈的强化学习(RLHF)

整合多来源偏好数据

偏好数据 preference_df,来源包含 'Journalist''Social Media Influencer''Marketing Professional'

一张表格,展示来自三种来源的结构化数据

来自人类反馈的强化学习(RLHF)

多数投票

此示例数据可按 'id' 分组便捷整合:

df_majority = preference_df.groupby(['id']).apply(majority_vote)

随后进行多数投票:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
来自人类反馈的强化学习(RLHF)

不可靠的偏好数据来源

偏好数据 preference_df2,同样来自三位专家:

一张表格,展示来自三种来源的结构化数据

来自人类反馈的强化学习(RLHF)

不可靠的偏好数据来源

  • 遍历 preference_df2 行以识别不可靠来源:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
来自人类反馈的强化学习(RLHF)

Vamos praticar!

来自人类反馈的强化学习(RLHF)

Preparing Video For Download...