Модели вознаграждения

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Mina Parham

AI Engineer

Пройденные этапы

Диаграмма, показывающая часть процесса RLHF, рассмотренную до сих пор.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Пройденные этапы

Диаграмма, показывающая пройденную часть процесса RLHF и стрелку, указывающую на следующий шаг — модели вознаграждения.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Что такое модель вознаграждения?

 

  Диаграмма, показывающая модель ИИ со стрелкой, указывающей на выходные данные.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Что такое модель вознаграждения?

  • Модель информирует агента
  • Агент оценивает модель для максимизации вознаграждений

Диаграмма, показывающая модель ИИ и агента, получающего данные от схемы вознаграждений, со стрелкой, указывающей на выходные данные.

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Использование RewardTrainer

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# Load pre-trained model and tokenizer
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# Load dataset in the required format dataset = load_dataset("path/to/dataset")
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Обучение модели вознаграждения

# Define training arguments
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Обучение модели вознаграждения

# Initialize the RewardTrainer
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# Train the reward model
trainer.train()
Обучение с подкреплением на основе обратной связи от людей (RLHF)

Давайте потренируемся!

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Preparing Video For Download...