Metody sběru kvalitní zpětné vazby

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Metody sběru kvalitní zpětné vazby

Proces RLHF bez modelu odměn.

Reinforcement Learning from Human Feedback (RLHF)

Metody sběru kvalitní zpětné vazby

Úplný proces RLHF.

Reinforcement Learning from Human Feedback (RLHF)

Párová srovnání

  • Výběr mezi dvěma možnostmi:
  • Výhody: Jednoduché, intuitivní, snižuje zkreslení
  • Nevýhody: Poskytuje méně informací na označení
  • Příklad: Film A vs. Film B: „Který preferujete?

Osoba drží v rukou dvě cedule: jednu s ikonou „Přijato" a druhou s ikonou „Odmítnuto".

Reinforcement Learning from Human Feedback (RLHF)

Párová srovnání

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Reinforcement Learning from Human Feedback (RLHF)

Hodnocení

  • Přiřazení skóre na stupnici:

  • Výhody: Poskytuje podrobnější zpětnou vazbu

  • Nevýhody: Náchylné k předsudkům, nekonzistentní stupnice
  • Příklad:
      Film A: 4/5
      Film B: 3/5
    

Ilustrace ženy držící hvězdu s ikonami hodnocení kolem ní.

Reinforcement Learning from Human Feedback (RLHF)

Psychologické faktory

  • Kognitivní zkreslení:
    • Efekt rámování: Způsob formulace otázky může ovlivnit odpovědi
    • Efekt pořadí: Pořadí možností může ovlivnit rozhodnutí
    • Ukotvení: Předchozí informace zkreslují aktuální rozhodnutí

Osoba vidí čtverec, ale vnímá ho jako obdélník – ilustrace konceptu zkreslení.

Reinforcement Learning from Human Feedback (RLHF)

Zásady sběru kvalitní zpětné vazby

 

  • Kognitivní zátěž: unavení uživatelé, nekonzistentní zpětná vazba
  • Pečlivá formulace otázek
    • Snižuje rizika plynoucí z kognitivní zátěže.
  • Náhodné pořadí otázek
    • Minimalizuje zkreslení způsobené ukotvením a rámováním.
  • Sběr různorodých dat
    • Zmírňuje problém šumu.

Muž a žena analyzují zpětnou vazbu a texty.

Reinforcement Learning from Human Feedback (RLHF)

Pojďme si to procvičit!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...