Intégrer des sources de rétroaction variées

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Généralisation du modèle améliorée

 

  • Représenter divers points de vue et contextes
  • Généraliser préférences et valeurs

Image de mains avec des bulles illustrant des opinions diverses.

Reinforcement Learning from Human Feedback (RLHF)

Biais réduit

  • Atténuer les biais individuels
  • Produire des résultats plus équilibrés et équitables

Diagramme à barres comparant un ensemble de données biaisé vers les hommes et un ensemble équilibré hommes-femmes

Reinforcement Learning from Human Feedback (RLHF)

Meilleure concordance avec les valeurs humaines

  • Préférences humaines complexes
  • Cultures et parcours représentés

Icônes représentant un groupe diversifié de personnes

Reinforcement Learning from Human Feedback (RLHF)

Adaptabilité accrue

  • Le modèle répond à un plus large éventail de besoins et préférences
  • Représenter différents points de vue

Icône d'une personne avec des émojis indiquant différents points de vue.

Reinforcement Learning from Human Feedback (RLHF)

Robustesse accrue

  • Résistant à divers types d'entrées
  • Amélioration du rendement

Schéma montrant une qualité améliorée grâce à des entrées et contextes variés.

Reinforcement Learning from Human Feedback (RLHF)

Intégrer des données de préférences de sources multiples

Données de préférences preference_df avec les sources « Journalist », « Social Media Influencer » et « Marketing Professional » :

Tableau montrant des données structurées de trois sources différentes

Reinforcement Learning from Human Feedback (RLHF)

Vote majoritaire

Ces données d'exemple s'intègrent facilement en groupant par « id » :

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Puis, au moyen du vote majoritaire :

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Reinforcement Learning from Human Feedback (RLHF)

Sources de préférences peu fiables

Données de préférences preference_df2 avec les mêmes trois spécialistes :

Tableau montrant des données structurées de trois sources différentes

Reinforcement Learning from Human Feedback (RLHF)

Sources de préférences peu fiables

  • Itérer sur les lignes de preference_df2 pour repérer les sources peu fiables :
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Reinforcement Learning from Human Feedback (RLHF)

Passons à la pratique !

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...