Začlenění různorodých zdrojů zpětné vazby

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Lepší generalizace modelu

 

  • Zastupuje různé úhly pohledu a kontexty
  • Zobecňuje preference a hodnoty

Obrázek rukou s různými bubliny představujícími různorodé názory.

Reinforcement Learning from Human Feedback (RLHF)

Snížení zaujatosti

  • Snižuje individuální zaujatosti
  • Vytváří vyváženější a spravedlivější výstup modelu

Sloupcový graf znázorňující rozdíl mezi datovou sadou s předpojatostí vůči mužské skupině a vyváženou datovou sadou s rovnoměrným zastoupením mužů a žen

Reinforcement Learning from Human Feedback (RLHF)

Lepší soulad s lidskými hodnotami

  • Komplexní lidské preference
  • Zastoupené kultury a prostředí

Ikony představující různorodou skupinu lidí

Reinforcement Learning from Human Feedback (RLHF)

Vyšší adaptabilita

  • Model reaguje na širší škálu potřeb a preferencí uživatelů
  • Zastupuje různé úhly pohledu

Ikona osoby s emodži znázorňujícími různé úhly pohledu.

Reinforcement Learning from Human Feedback (RLHF)

Větší robustnost

  • Odolný vůči různým typům vstupů
  • Zlepšuje svůj výkon

Diagram znázorňující zlepšení kvality díky různým vstupům a kontextům.

Reinforcement Learning from Human Feedback (RLHF)

Integrace dat preferencí z více zdrojů

Data preferencí preference_df se zdroji 'Journalist', 'Social Media Influencer' a 'Marketing Professional':

Tabulka se strukturovanými daty ze tří různých zdrojů

Reinforcement Learning from Human Feedback (RLHF)

Hlasování většinou

Tato ukázková data lze snadno integrovat seskupením podle 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Poté pomocí hlasování většinou:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

Nespolehlivé zdroje dat preferencí

Data preferencí preference_df2 se stejnými třemi odborníky:

Tabulka se strukturovanými daty ze tří různých zdrojů

Reinforcement Learning from Human Feedback (RLHF)

Nespolehlivé zdroje dat preferencí

  • Iterace přes řádky preference_df2 za účelem identifikace nespolehlivých zdrojů:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

Pojďme si procvičit!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...