Integrarea unor surse diverse de feedback

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Generalizare îmbunătățită a modelului

 

  • Reprezintă puncte de vedere și contexte diferite
  • Generalizează preferințele și valorile

Imagine cu mâini și bule de dialog reprezentând opinii diverse.

Reinforcement Learning from Human Feedback (RLHF)

Reducerea părtinirii

  • Atenuează părtinirile individuale
  • Creează un rezultat mai echilibrat și echitabil

Grafic cu bare care arată diferența dintre un set de date părtinitor față de un grup masculin și un set echilibrat cu distribuție egală pentru bărbați și femei

Reinforcement Learning from Human Feedback (RLHF)

Aliniere mai bună cu valorile umane

  • Preferințe umane complexe
  • Culturi și medii reprezentate

Pictograme reprezentând un grup divers de persoane

Reinforcement Learning from Human Feedback (RLHF)

Adaptabilitate îmbunătățită

  • Modelul răspunde unei game mai largi de nevoi și preferințe
  • Reprezintă puncte de vedere diferite

O pictogramă cu o persoană și emoji-uri care indică puncte de vedere diferite.

Reinforcement Learning from Human Feedback (RLHF)

Robustețe crescută

  • Rezistent la diferite tipuri de intrări
  • Performanță îmbunătățită

O diagramă care arată calitate îmbunătățită datorită unor intrări și contexte diferite.

Reinforcement Learning from Human Feedback (RLHF)

Integrarea datelor de preferință din mai multe surse

Date de preferință preference_df cu sursele 'Journalist', 'Social Media Influencer' și 'Marketing Professional':

Un tabel cu date structurate din trei surse diferite

Reinforcement Learning from Human Feedback (RLHF)

Votul majoritar

Aceste date pot fi integrate prin grupare după 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Apoi, folosind votul majoritar:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

Surse nesigure de date de preferință

Date de preferință preference_df2 cu aceiași trei experți:

Un tabel cu date structurate din trei surse diferite

Reinforcement Learning from Human Feedback (RLHF)

Surse nesigure de date de preferință

  • Iterare prin rândurile din preference_df2 pentru a identifica sursele nesigure:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

Să exersăm!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...