Залучення різних джерел відгуків

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Краща узагальнювальна здатність моделі

 

  • Представляє різні погляди й контексти
  • Узагальнює вподобання та цінності

Зображення рук із різними бульбашками-коментарями, що уособлюють різні думки.

Reinforcement Learning from Human Feedback (RLHF)

Зменшення упереджень

  • Зменшує індивідуальні упередження
  • Формує більш збалансований і справедливий результат моделі

Стовпчикова діаграма, що показує різницю між набором даних з упередженням на користь чоловіків і збалансованим набором із рівним розподілом для жінок і чоловіків

Reinforcement Learning from Human Feedback (RLHF)

Краще узгодження з людськими цінностями

  • Складні людські вподобання
  • Представлені культури та бекграунди

Піктограми, що уособлюють різноманітну групу людей

Reinforcement Learning from Human Feedback (RLHF)

Підвищена адаптивність

  • Модель відповідає ширшому колу потреб і вподобань користувачів
  • Представляє різні точки зору

Піктограма людини з емодзі, що відображають різні погляди.

Reinforcement Learning from Human Feedback (RLHF)

Зростання надійності

  • Стійкість до різних типів вхідних даних
  • Поліпшення продуктивності

Схема, що показує покращення якості завдяки різним вхідним даним і контекстам.

Reinforcement Learning from Human Feedback (RLHF)

Інтеграція даних вподобань із кількох джерел

Дані вподобань preference_df з джерелами 'Journalist', 'Social Media Influencer' та 'Marketing Professional':

Таблиця зі структурованими даними з трьох різних джерел

Reinforcement Learning from Human Feedback (RLHF)

Голосування більшості

Ці зразкові дані легко інтегрувати, згрупувавши за 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Далі застосуйте правило більшості:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

Ненадійні джерела даних про вподобання

Дані вподобань preference_df2 із тими самими трьома експертами:

Таблиця зі структурованими даними з трьох різних джерел

Reinforcement Learning from Human Feedback (RLHF)

Ненадійні джерела даних про вподобання

  • Ітерування рядками preference_df2 для виявлення ненадійних джерел:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

Давайте потренуємось!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...