奖励模型解析

来自人类反馈的强化学习(RLHF)

Mina Parham

AI Engineer

当前进度

展示截至目前涵盖的 RLHF 流程部分的示意图。

来自人类反馈的强化学习(RLHF)

当前进度

展示截至目前的 RLHF 流程示意图,并有一个箭头指向下一步:奖励模型。

来自人类反馈的强化学习(RLHF)

什么是奖励模型?

 

  一个图示:AI 模型,箭头指向输出。

来自人类反馈的强化学习(RLHF)

什么是奖励模型?

  • 模型智能体提供信息
  • 智能体评估模型以最大化奖励

一个图示:AI 模型与由奖励机制指导的智能体,箭头指向输出。

来自人类反馈的强化学习(RLHF)

使用 RewardTrainer

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# Load pre-trained model and tokenizer
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# Load dataset in the required format dataset = load_dataset("path/to/dataset")
来自人类反馈的强化学习(RLHF)

训练奖励模型

# Define training arguments
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
来自人类反馈的强化学习(RLHF)

训练奖励模型

# Initialize the RewardTrainer
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# Train the reward model
trainer.train()
来自人类反馈的强化学习(RLHF)

Vamos praticar!

来自人类反馈的强化学习(RLHF)

Preparing Video For Download...