Wprowadzenie do RLHF

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Mina Parham

AI Engineer

Witamy na kursie!

 

  • Instruktor: Mina Parham

 

  • Inżynier AI
  • Duże modele językowe (LLM)
  • Uczenie ze wzmocnieniem na podstawie opinii człowieka (RLHF)

 

  • Temat: Uczenie ze wzmocnieniem na podstawie opinii człowieka (RLHF)

Diagram przedstawiający model AI z dodatkowym krokiem z udziałem człowieka.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Witamy na kursie!

 

  • Instruktor: Mina Parham

 

  • Inżynier AI
  • Duże modele językowe (LLM)
  • Uczenie ze wzmocnieniem na podstawie opinii człowieka (RLHF)

 

  • Temat: Uczenie ze wzmocnieniem na podstawie opinii człowieka (RLHF)

Diagram przedstawiający model AI z dodatkowym krokiem z udziałem człowieka, prowadzącym do lepszych wyników.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Przegląd uczenia ze wzmocnieniem

Diagram przedstawiający ikonę agenta, akcję i politykę nagrody w cyklu, reprezentujący proces uczenia ze wzmocnieniem.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Przegląd uczenia ze wzmocnieniem

Diagram przedstawiający ikonę agenta, akcję i politykę nagrody w cyklu, reprezentujący proces uczenia ze wzmocnieniem.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Przegląd uczenia ze wzmocnieniem

Diagram przedstawiający ikonę agenta, akcję i politykę nagrody w cyklu, reprezentujący proces uczenia ze wzmocnieniem.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Przegląd uczenia ze wzmocnieniem

Diagram przedstawiający ikonę agenta, akcję i politykę nagrody w cyklu, reprezentujący proces uczenia ze wzmocnieniem.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Od RL do RLHF

 

  Diagram przedstawiający ikonę LLM, wynik tekstowy i ewaluatora człowieka, reprezentujący część cyklu uczenia ze wzmocnieniem na podstawie opinii człowieka.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Od RL do RLHF

 

  Diagram przedstawiający ikonę LLM, wynik tekstowy i ewaluatora człowieka, reprezentujący część cyklu uczenia ze wzmocnieniem na podstawie opinii człowieka.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Od RL do RLHF

  • Trenowanie modelu nagrody
  • Dostosowanie do preferencji człowieka

Diagram przedstawiający ikonę LLM, wynik tekstowy i ewaluatora człowieka, reprezentujący część cyklu uczenia ze wzmocnieniem na podstawie opinii człowieka.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Dostrajanie LLM w RLHF

 

Ikona dużego modelu językowego.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Dostrajanie LLM w RLHF

  • Trenowanie wstępnego LLM

Ikona dużego modelu językowego dostrojonego przy użyciu wejściowego zbioru danych.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Pełny proces RLHF

Zapytanie „Who wrote Romeo and Juliet" przekazywane do LLM.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Pełny proces RLHF

Zapytanie „Who wrote Romeo and Juliet" z odpowiedzią LLM: „a 16th Century author".

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Pełny proces RLHF

Zapytanie „Who wrote Romeo and Juliet" z odpowiedzią LLM: „a 16th Century author" oraz dodatkowym modelem polityki odbierającym zapytanie.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Pełny proces RLHF

Zapytanie „Who wrote Romeo and Juliet" z odpowiedzią LLM: „a 16th Century author" oraz dodatkowym modelem polityki trenowanym przy użyciu modelu nagrody.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Pełny proces RLHF

Zapytanie „Who wrote Romeo and Juliet" z odpowiedzią LLM: „a 16th Century author" oraz modelem polityki trenowanym przez model nagrody, dającym odpowiedź „William Shakespeare".

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Pełny proces RLHF

Zapytanie „Who wrote Romeo and Juliet" z odpowiedzią LLM: „a 16th Century author", modelem polityki dającym odpowiedź „William Shakespeare" oraz porównaniem obu wyników.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Korzystanie z LLM dostrojonych przez RLHF

  • Wstępnie wytrenowane modele RLHF na Hugging Face 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Korzystanie z LLM dostrojonych przez RLHF

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czas na ćwiczenia!

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Preparing Video For Download...