Introduktion till RLHF

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Välkommen till kursen!

 

  • Instruktör: Mina Parham

 

  • AI-ingenjör
  • Large Language Models (LLMs)
  • Reinforcement Learning from Human Feedback (RLHF)

 

  • Ämne: Reinforcement Learning from Human Feedback (RLHF)

Ett diagram som representerar en AI-modell med ett extra steg där en människa är involverad.

Reinforcement Learning from Human Feedback (RLHF)

Välkommen till kursen!

 

  • Instruktör: Mina Parham

 

  • AI-ingenjör
  • Large Language Models (LLMs)
  • Reinforcement Learning from Human Feedback (RLHF)

 

  • Ämne: Reinforcement Learning from Human Feedback (RLHF)

Ett diagram som representerar en AI-modell med ett extra steg där en människa är involverad, vilket leder till bättre resultat.

Reinforcement Learning from Human Feedback (RLHF)

Repetition: förstärkningsinlärning

Ett diagram som visar en ikon för en agent, en åtgärd och en belöningspolicy i en cykel, vilket representerar processen för förstärkningsinlärning.

Reinforcement Learning from Human Feedback (RLHF)

Repetition: förstärkningsinlärning

Ett diagram som visar en ikon för en agent, en åtgärd och en belöningspolicy i en cykel, vilket representerar processen för förstärkningsinlärning.

Reinforcement Learning from Human Feedback (RLHF)

Repetition: förstärkningsinlärning

Ett diagram som visar en ikon för en agent, en åtgärd och en belöningspolicy i en cykel, vilket representerar processen för förstärkningsinlärning.

Reinforcement Learning from Human Feedback (RLHF)

Repetition: förstärkningsinlärning

Ett diagram som visar en ikon för en agent, en åtgärd och en belöningspolicy i en cykel, vilket representerar processen för förstärkningsinlärning.

Reinforcement Learning from Human Feedback (RLHF)

Från RL till RLHF

 

  Ett diagram som visar en ikon för en LLM, ett textutdata och en mänsklig utvärderare, vilket representerar en del av cykeln för förstärkningsinlärning från mänsklig feedback.

Reinforcement Learning from Human Feedback (RLHF)

Från RL till RLHF

 

  Ett diagram som visar en ikon för en LLM, ett textutdata och en mänsklig utvärderare, vilket representerar en del av cykeln för förstärkningsinlärning från mänsklig feedback.

Reinforcement Learning from Human Feedback (RLHF)

Från RL till RLHF

  • Träning av belöningsmodellen
  • Anpassning till mänskliga preferenser

Ett diagram som visar en ikon för en LLM, ett textutdata och en mänsklig utvärderare, vilket representerar en del av cykeln för förstärkningsinlärning från mänsklig feedback.

Reinforcement Learning from Human Feedback (RLHF)

Finjustering av LLM i RLHF

 

En ikon för en stor språkmodell.

Reinforcement Learning from Human Feedback (RLHF)

Finjustering av LLM i RLHF

  • Träning av den initiala LLM:en

En ikon för en stor språkmodell som finjusterats med hjälp av en indatamängd.

Reinforcement Learning from Human Feedback (RLHF)

Hela RLHF-processen

En prompt med frågan "Who wrote Romeo and Juliet" som skickas till en LLM.

Reinforcement Learning from Human Feedback (RLHF)

Hela RLHF-processen

En prompt med frågan "Who wrote Romeo and Juliet" där en LLM svarar: "a 16th Century author".

Reinforcement Learning from Human Feedback (RLHF)

Hela RLHF-processen

En prompt med frågan "Who wrote Romeo and Juliet" där en LLM svarar: "a 16th Century author", och en ytterligare modell, en policymodell, tar emot prompten.

Reinforcement Learning from Human Feedback (RLHF)

Hela RLHF-processen

En prompt med frågan "Who wrote Romeo and Juliet" där en LLM svarar: "a 16th Century author", och en ytterligare modell, en policymodell, tar emot prompten och tränas med hjälp av en belöningsmodell.

Reinforcement Learning from Human Feedback (RLHF)

Hela RLHF-processen

En prompt med frågan "Who wrote Romeo and Juliet" där en LLM svarar: "a 16th Century author", och en ytterligare modell, en policymodell, tränas med hjälp av en belöningsmodell och ger svaret "William Shakespeare".

Reinforcement Learning from Human Feedback (RLHF)

Hela RLHF-processen

En prompt med frågan "Who wrote Romeo and Juliet" där en LLM svarar: "a 16th Century author", och en ytterligare modell, en policymodell, tränas med hjälp av en belöningsmodell och ger svaret "William Shakespeare", samt en jämförelse mellan de två resultaten.

Reinforcement Learning from Human Feedback (RLHF)

Interagera med RLHF-finjusterade LLMs

  • Förtränade RLHF-modeller på Hugging Face 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
Reinforcement Learning from Human Feedback (RLHF)

Interagera med RLHF-finjusterade LLMs

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
Reinforcement Learning from Human Feedback (RLHF)

Nu kör vi en övning!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...