Введение в RLHF

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Mina Parham

AI Engineer

Добро пожаловать на курс!

 

  • Инструктор: Mina Parham

 

  • AI Engineer
  • Large Language Models (LLMs)
  • Reinforcement Learning from Human Feedback (RLHF)

 

  • Тема: Reinforcement Learning from Human Feedback (RLHF)

Диаграмма модели ИИ с дополнительным шагом участия человека.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Добро пожаловать на курс!

 

  • Инструктор: Mina Parham

 

  • AI Engineer
  • Large Language Models (LLMs)
  • Reinforcement Learning from Human Feedback (RLHF)

 

  • Тема: Reinforcement Learning from Human Feedback (RLHF)

Диаграмма модели ИИ с дополнительным шагом участия человека, ведущим к лучшим результатам.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Обзор обучения с подкреплением

Диаграмма с иконками агента, действия и политики вознаграждения в цикле — процесс обучения с подкреплением.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Обзор обучения с подкреплением

Диаграмма с иконками агента, действия и политики вознаграждения в цикле — процесс обучения с подкреплением.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Обзор обучения с подкреплением

Диаграмма с иконками агента, действия и политики вознаграждения в цикле — процесс обучения с подкреплением.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Обзор обучения с подкреплением

Диаграмма с иконками агента, действия и политики вознаграждения в цикле — процесс обучения с подкреплением.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

От RL к RLHF

 

  Диаграмма с иконками LLM, текстового вывода и оценщика-человека — часть цикла RLHF.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

От RL к RLHF

 

  Диаграмма с иконками LLM, текстового вывода и оценщика-человека — часть цикла RLHF.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

От RL к RLHF

  • Обучение модели вознаграждения
  • Согласование с предпочтениями человека

Диаграмма с иконками LLM, текстового вывода и оценщика-человека — часть цикла RLHF.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Дообучение LLM в RLHF

 

Иконка большой языковой модели.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Дообучение LLM в RLHF

  • Обучение исходной LLM

Иконка большой языковой модели, дообученной на входном наборе данных.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Полный процесс RLHF

Запрос «Who wrote Romeo and Juliet», поступающий в LLM.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Полный процесс RLHF

Запрос «Who wrote Romeo and Juliet» и ответ LLM: «a 16th Century author».

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Полный процесс RLHF

Запрос «Who wrote Romeo and Juliet», ответ LLM «a 16th Century author» и дополнительная модель — политическая — получающая тот же запрос.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Полный процесс RLHF

Запрос «Who wrote Romeo and Juliet», ответ LLM «a 16th Century author» и дополнительная политическая модель, обучаемая с помощью модели вознаграждения.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Полный процесс RLHF

Запрос «Who wrote Romeo and Juliet», ответ LLM «a 16th Century author» и политическая модель, обучаемая с помощью модели вознаграждения и выдающая ответ «William Shakespeare».

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Полный процесс RLHF

Запрос «Who wrote Romeo and Juliet», ответ LLM «a 16th Century author», политическая модель с ответом «William Shakespeare» и сравнение двух результатов.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Взаимодействие с LLM, настроенными с помощью RLHF

  • Предобученные RLHF-модели на Hugging Face 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Взаимодействие с LLM, настроенными с помощью RLHF

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Давайте потренируемся!

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Preparing Video For Download...