獎勵模型詳解

Reinforcement Learning from Human Feedback(RLHF)

Mina Parham

AI Engineer

目前流程

顯示目前已涵蓋之 RLHF 流程部分的示意圖。

Reinforcement Learning from Human Feedback(RLHF)

目前流程

顯示目前已涵蓋之 RLHF 流程的示意圖,並以箭頭指向下一步:獎勵模型。

Reinforcement Learning from Human Feedback(RLHF)

什麼是獎勵模型?

 

  顯示一個 AI 模型並以箭頭指向輸出的示意圖。

Reinforcement Learning from Human Feedback(RLHF)

什麼是獎勵模型?

  • 模型 提供 代理 資訊
  • 代理模型 評估以最大化 獎勵

顯示一個 AI 模型與受獎勵機制引導的代理,並以箭頭指向輸出的示意圖。

Reinforcement Learning from Human Feedback(RLHF)

使用 reward trainer

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# Load pre-trained model and tokenizer
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# Load dataset in the required format dataset = load_dataset("path/to/dataset")
Reinforcement Learning from Human Feedback(RLHF)

訓練獎勵模型

# Define training arguments
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
Reinforcement Learning from Human Feedback(RLHF)

訓練獎勵模型

# Initialize the RewardTrainer
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# Train the reward model
trainer.train()
Reinforcement Learning from Human Feedback(RLHF)

一起來練習吧!

Reinforcement Learning from Human Feedback(RLHF)

Preparing Video For Download...