Introducere în RLHF

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Bun venit la curs!

 

  • Instructor: Mina Parham

 

  • Inginer AI
  • Modele lingvistice mari (LLM-uri)
  • Învățare prin întărire din feedback uman (RLHF)

 

  • Subiect: Învățare prin întărire din feedback uman (RLHF)

O diagramă reprezentând un model AI cu un pas suplimentar în care este implicat un om.

Reinforcement Learning from Human Feedback (RLHF)

Bun venit la curs!

 

  • Instructor: Mina Parham

 

  • Inginer AI
  • Modele lingvistice mari (LLM-uri)
  • Învățare prin întărire din feedback uman (RLHF)

 

  • Subiect: Învățare prin întărire din feedback uman (RLHF)

O diagramă reprezentând un model AI cu un pas suplimentar în care este implicat un om, conducând la rezultate mai bune.

Reinforcement Learning from Human Feedback (RLHF)

Recapitulare: învățare prin întărire

O diagramă care arată pictograma unui agent, o acțiune și o politică de recompensă într-un ciclu, reprezentând procesul de învățare prin întărire.

Reinforcement Learning from Human Feedback (RLHF)

Recapitulare: învățare prin întărire

O diagramă care arată pictograma unui agent, o acțiune și o politică de recompensă într-un ciclu, reprezentând procesul de învățare prin întărire.

Reinforcement Learning from Human Feedback (RLHF)

Recapitulare: învățare prin întărire

O diagramă care arată pictograma unui agent, o acțiune și o politică de recompensă într-un ciclu, reprezentând procesul de învățare prin întărire.

Reinforcement Learning from Human Feedback (RLHF)

Recapitulare: învățare prin întărire

O diagramă care arată pictograma unui agent, o acțiune și o politică de recompensă într-un ciclu, reprezentând procesul de învățare prin întărire.

Reinforcement Learning from Human Feedback (RLHF)

De la RL la RLHF

 

  O diagramă care arată pictograma unui LLM, un text generat și un evaluator uman, reprezentând o parte din ciclul RLHF.

Reinforcement Learning from Human Feedback (RLHF)

De la RL la RLHF

 

  O diagramă care arată pictograma unui LLM, un text generat și un evaluator uman, reprezentând o parte din ciclul RLHF.

Reinforcement Learning from Human Feedback (RLHF)

De la RL la RLHF

  • Antrenarea modelului de recompensă
  • Aliniere cu preferințele umane

O diagramă care arată pictograma unui LLM, un text generat și un evaluator uman, reprezentând o parte din ciclul RLHF.

Reinforcement Learning from Human Feedback (RLHF)

Ajustarea fină a LLM-urilor în RLHF

 

Pictograma unui model lingvistic mare.

Reinforcement Learning from Human Feedback (RLHF)

Ajustarea fină a LLM-urilor în RLHF

  • Antrenarea LLM-ului inițial

Pictograma unui model lingvistic mare ajustat fin folosind un set de date de intrare.

Reinforcement Learning from Human Feedback (RLHF)

Procesul complet RLHF

Un prompt cu întrebarea „Cine a scris Romeo și Julieta" intrând într-un LLM.

Reinforcement Learning from Human Feedback (RLHF)

Procesul complet RLHF

Un prompt cu întrebarea „Cine a scris Romeo și Julieta", cu un LLM răspunzând: „un autor din secolul al XVI-lea".

Reinforcement Learning from Human Feedback (RLHF)

Procesul complet RLHF

Un prompt cu întrebarea „Cine a scris Romeo și Julieta", cu un LLM răspunzând: „un autor din secolul al XVI-lea", și un model suplimentar, un model de politică, care primește promptul.

Reinforcement Learning from Human Feedback (RLHF)

Procesul complet RLHF

Un prompt cu întrebarea „Cine a scris Romeo și Julieta", cu un LLM răspunzând: „un autor din secolul al XVI-lea", și un model suplimentar, un model de politică, care primește promptul și este antrenat cu un model de recompensă.

Reinforcement Learning from Human Feedback (RLHF)

Procesul complet RLHF

Un prompt cu întrebarea „Cine a scris Romeo și Julieta", cu un LLM răspunzând: „un autor din secolul al XVI-lea", și un model de politică antrenat cu un model de recompensă, oferind răspunsul „William Shakespeare".

Reinforcement Learning from Human Feedback (RLHF)

Procesul complet RLHF

Un prompt cu întrebarea „Cine a scris Romeo și Julieta", cu un LLM răspunzând: „un autor din secolul al XVI-lea", și un model de politică antrenat cu un model de recompensă, oferind răspunsul „William Shakespeare", și o verificare între cele două rezultate.

Reinforcement Learning from Human Feedback (RLHF)

Interacțiunea cu LLM-uri ajustate prin RLHF

  • Modele RLHF pre-antrenate pe Hugging Face 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
Reinforcement Learning from Human Feedback (RLHF)

Interacțiunea cu LLM-uri ajustate prin RLHF

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
Reinforcement Learning from Human Feedback (RLHF)

Să exersăm!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...