Metoder för högkvalitativ feedbackinsamling

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Metoder för högkvalitativ feedbackinsamling

RLHF-processen utan belöningsmodell.

Reinforcement Learning from Human Feedback (RLHF)

Metoder för högkvalitativ feedbackinsamling

Den fullständiga RLHF-processen.

Reinforcement Learning from Human Feedback (RLHF)

Parjämförelser

  • Välja mellan två alternativ:
  • Fördelar: Enkelt, intuitivt, minskar bias
  • Utmaningar: Ger mindre information per etikett
  • Exempel: Film A vs. Film B: "Vilken föredrar du?

En person som håller två skyltar: en med en "Accepterad"-ikon och en med en "Avslagen"-ikon.

Reinforcement Learning from Human Feedback (RLHF)

Parjämförelser

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
Reinforcement Learning from Human Feedback (RLHF)

Betyg

  • Tilldela ett poäng på en skala:

  • Fördelar: Ger mer detaljerad feedback

  • Utmaningar: Känslig för bias, inkonsekventa skalor
  • Exempel:
      Film A: 4/5
      Film B: 3/5
    

En illustration av en kvinna som håller en stjärna med ikoner för betyg runt sig.

Reinforcement Learning from Human Feedback (RLHF)

Psykologiska faktorer

  • Kognitiva biaser:
    • Inramningseffekt: Hur en fråga formuleras kan påverka svaren
    • Seriepositionseffekt: Ordningen på alternativen kan påverka beslut
    • Förankring: Tidigare information påverkar nuvarande beslut

En person som ser en kvadrat men uppfattar den som en rektangel i sitt sinne – illustrerar konceptet bias.

Reinforcement Learning from Human Feedback (RLHF)

Riktlinjer för högkvalitativ feedbackinsamling

 

  • Kognitiv belastning: trötta användare, inkonsekvent feedback
  • Formulera frågorna noggrant
    • För att motverka risker från kognitiv belastning.
  • Slumpa frågornas ordning
    • För att minimera bias från förankring och inramning.
  • Samla in diversifierad data
    • För att minska problemet med brus.

En man och en kvinna som analyserar feedback och texter.

Reinforcement Learning from Human Feedback (RLHF)

Nu kör vi en övning!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...