Metode pentru colectarea feedback-ului de calitate

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Metode pentru colectarea feedback-ului de calitate

Procesul RLHF, fără modelul de recompensă.

Reinforcement Learning from Human Feedback (RLHF)

Metode pentru colectarea feedback-ului de calitate

Procesul complet RLHF.

Reinforcement Learning from Human Feedback (RLHF)

Comparații pereche

  • Alegerea între două opțiuni:
  • Avantaje: Simplu, intuitiv, reduce erorile
  • Provocări: Oferă mai puține informații per etichetă
  • Exemplu: Film A vs. Film B: „Pe care îl preferi?

O persoană ținând două semne: unul cu pictograma „Acceptat" și altul cu „Respins".

Reinforcement Learning from Human Feedback (RLHF)

Comparații pereche

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Reinforcement Learning from Human Feedback (RLHF)

Evaluări

  • Atribuirea unui scor pe o scală:

  • Avantaje: Oferă feedback mai detaliat

  • Provocări: Predispus la erori, scale inconsistente
  • Exemplu:
      Film A: 4/5
      Film B: 3/5
    

Ilustrație cu o femeie ținând o stea, înconjurată de pictograme reprezentând evaluări.

Reinforcement Learning from Human Feedback (RLHF)

Factori psihologici

  • Erori cognitive:
    • Efectul de încadrare: Modul în care este formulată o întrebare poate influența răspunsurile
    • Efectul poziției seriale: Ordinea opțiunilor poate afecta deciziile
    • Ancorarea: Informațiile anterioare influențează deciziile curente

O persoană care vede un pătrat, dar îl interpretează mental ca un dreptunghi, ilustrând conceptul de eroare cognitivă.

Reinforcement Learning from Human Feedback (RLHF)

Ghid pentru colectarea feedback-ului de calitate

 

  • Încărcare cognitivă: utilizatori obosiți, feedback inconsistent
  • Formulați cu atenție întrebările
    • Pentru a reduce riscurile asociate încărcării cognitive.
  • Randomizați ordinea întrebărilor
    • Pentru a minimiza erorile de ancorare și încadrare.
  • Colectați date diverse
    • Pentru a reduce efectul zgomotului.

Un bărbat și o femeie analizând feedback și texte.

Reinforcement Learning from Human Feedback (RLHF)

Să exersăm!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...