Att integrera olika feedbackkällor

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Förbättrad modellgeneralisering

 

  • Representerar olika perspektiv och sammanhang
  • Generaliserar preferenser och värderingar

En bild på händer med olika pratbubblor som representerar skilda åsikter.

Reinforcement Learning from Human Feedback (RLHF)

Minskad snedvridning

  • Motverkar individuella snedvridningar
  • Skapar ett mer balanserat och rättvist modellresultat

Ett stapeldiagram som visar skillnaden mellan ett dataset med manlig slagsida och ett balanserat dataset med jämn fördelning mellan män och kvinnor

Reinforcement Learning from Human Feedback (RLHF)

Bättre anpassning till mänskliga värderingar

  • Komplexa mänskliga preferenser
  • Kulturer och bakgrunder representerade

Ikoner som representerar en mångfaldig grupp människor

Reinforcement Learning from Human Feedback (RLHF)

Ökad anpassningsförmåga

  • Modellen svarar på ett bredare spektrum av användarbehov och preferenser
  • Representerar olika perspektiv

En ikon som visar en person med emojis som indikerar olika perspektiv.

Reinforcement Learning from Human Feedback (RLHF)

Ökad robusthet

  • Robust mot olika typer av indata
  • Förbättrar modellens prestanda

Ett diagram som visar förbättrad kvalitet tack vare olika indata och sammanhang.

Reinforcement Learning from Human Feedback (RLHF)

Integrera preferensdata från flera källor

Preferensdata preference_df med källorna 'Journalist', 'Social Media Influencer' och 'Marketing Professional':

En tabell med strukturerad data från tre olika källor

Reinforcement Learning from Human Feedback (RLHF)

Majoritetsröstning

Dessa exempeldata kan enkelt integreras genom att gruppera på 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Sedan, med majoritetsröstning:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

Opålitliga preferensdatakällor

Preferensdata preference_df2 med samma tre experter:

En tabell med strukturerad data från tre olika källor

Reinforcement Learning from Human Feedback (RLHF)

Opålitliga preferensdatakällor

  • Itererar över raderna i preference_df2 för att identifiera opålitliga källor:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

Nu kör vi en övning!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...