Ocena modeli RLHF

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Mina Parham

AI Engineer

Metryki automatyczne

 

  • Zadanie klasyfikacji: dokładność, wynik F1
classification_results.head(3)
| ID | Feedback_Text                         | True_Category | Predicted_Category |
|----|---------------------------------------|---------------|--------------------|
| 1  | "Arrived on time and works great."    | Positive      | Positive           |
| 2  | "I had issues with customer service." | Negative      | Neutral            |
| 3  | "The website is easy to navigate."    | Positive      | Positive           |
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Metryki automatyczne

 

  • Generowanie tekstu, podsumowanie: ROUGE, BLEU
text_generation.head(3)
| ID | Prompt               | True_Completion  | Pred_Completion   |
|----|----------------------|------------------|-------------------|
| 1  | "Customer service"   | "can help you."  | "will assist."    |
| 2  | "To get a refund,"   | "contact us."    | "reach out."      |
| 3  | "Support team is"    | "here 24/7."     | "available 24/7." |
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Metryki automatyczne

 

 

Zdanie referencyjne:

  • RLHF poprawia dopasowanie modelu do ludzkich wartości.

 

 

Wynik ROUGE: 0.83

 

 

Zdanie do porównania:

  • RLHF dopasowuje modele do ludzkich wartości.
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Krzywe artefaktów

config = PPOConfig(
    model_name="lvwerra/gpt2-imdb",learning_rate=1.41e-5, log_with="wandb")
import wandb
wandb.init()

Zrzut ekranu wyjścia terminala w Weights and Biases.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Krzywe artefaktów

  • Nagroda rośnie w miarę uczenia się modelu.

Krzywa pokazująca rosnący trend nagrody, co oznacza poprawę modelu.

  • Krzywa KL powinna rosnąć stopniowo.

Krzywa pokazująca stopniowy wzrost straty KL.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Ocena skoncentrowana na człowieku

  • Ocena ludzka: subiektywne oceny lub głębokie rozumienie kontekstu

Ludzki oceniający przy laptopie.

  • Ocena modeli: skalowalność i spójność

Robot z dymkami mowy reprezentujący oceniający model.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czas na praktykę!

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Preparing Video For Download...