Uwzględnianie różnorodnych źródeł opinii

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Mina Parham

AI Engineer

Lepsza generalizacja modelu

 

  • Reprezentuje różne punkty widzenia i konteksty
  • Uogólnia preferencje i wartości

Obraz rąk z dymkami reprezentującymi różnorodne opinie.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zmniejszone uprzedzenia

  • Ogranicza indywidualne uprzedzenia
  • Tworzy bardziej wyważone i sprawiedliwe wyniki modelu

Wykres słupkowy pokazujący różnicę między zbiorem danych z tendencją do grupy męskiej a zrównoważonym zbiorem danych z równym rozkładem dla mężczyzn i kobiet

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Lepsze dopasowanie do ludzkich wartości

  • Złożone preferencje ludzkie
  • Reprezentowane kultury i środowiska

Ikony przedstawiające zróżnicowaną grupę ludzi

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Lepsza adaptowalność

  • Model reaguje na szerszy zakres potrzeb i preferencji użytkowników
  • Reprezentuje różne punkty widzenia

Ikona przedstawiająca osobę z emotikonami symbolizującymi różne punkty widzenia.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Większa odporność

  • Odporny na różne typy danych wejściowych
  • Poprawia swoją wydajność

Diagram pokazujący poprawę jakości dzięki różnym danym wejściowym i kontekstom.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Integrowanie danych preferencji z wielu źródeł

Dane preferencji preference_df ze źródłami 'Journalist', 'Social Media Influencer' i 'Marketing Professional':

Tabela przedstawiająca ustrukturyzowane dane z trzech różnych źródeł

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Głosowanie większościowe

Te przykładowe dane można łatwo zintegrować, grupując według 'id':

df_majority = preference_df.groupby(['id']).apply(majority_vote)

Następnie, stosując głosowanie większościowe:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zawodne źródła danych preferencji

Dane preferencji preference_df2 z tymi samymi trzema ekspertami:

Tabela przedstawiająca ustrukturyzowane dane z trzech różnych źródeł

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zawodne źródła danych preferencji

  • Iterowanie po wierszach preference_df2 w celu identyfikacji zawodnych źródeł:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czas na ćwiczenia!

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Preparing Video For Download...