Metody zbierania wysokiej jakości opinii

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Mina Parham

AI Engineer

Metody zbierania wysokiej jakości opinii

Proces RLHF bez modelu nagrody.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Metody zbierania wysokiej jakości opinii

Pełny proces RLHF.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Porównania parami

  • Wybór między dwiema opcjami:
  • Zalety: Proste, intuicyjne, ogranicza błędy
  • Wyzwania: Dostarcza mniej informacji na etykietę
  • Przykład: Film A kontra Film B: „Który wolisz?

Osoba trzymająca dwa znaki: jeden z ikoną „Zaakceptowane" i jeden z ikoną „Odrzucone".

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Porównania parami

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Oceny

  • Przypisywanie oceny w skali:

  • Zalety: Dostarcza bardziej szczegółowych opinii

  • Wyzwania: Podatne na błędy, niespójne skale
  • Przykład:
      Film A: 4/5
      Film B: 3/5
    

Ilustracja kobiety trzymającej gwiazdkę z ikonami reprezentującymi oceny wokół niej.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czynniki psychologiczne

  • Błędy poznawcze:
    • Efekt ramowania: Sposób sformułowania pytania może wpływać na odpowiedzi
    • Efekt kolejności: Kolejność prezentowanych opcji może wpływać na decyzje
    • Zakotwiczenie: Wcześniejsze informacje zniekształcają bieżące decyzje

Osoba widząca kwadrat oczami, lecz interpretująca go jako prostokąt – ilustracja błędu poznawczego.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Wskazówki dotyczące zbierania wysokiej jakości opinii

 

  • Obciążenie poznawcze: zmęczeni użytkownicy, niespójne opinie
  • Staranne formułowanie pytań
    • Ogranicza ryzyko wynikające z obciążenia poznawczego.
  • Losowanie kolejności pytań
    • Minimalizuje błędy zakotwiczenia i ramowania.
  • Zbieranie zróżnicowanych danych
    • Ogranicza problem szumów.

Mężczyzna i kobieta analizujący opinie i teksty.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czas na ćwiczenia!

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Preparing Video For Download...