報酬モデルを探る

人間のフィードバックによる強化学習(RLHF)

Mina Parham

AI Engineer

ここまでの流れ

これまでに扱ったRLHFプロセスの部分を示す図。

人間のフィードバックによる強化学習(RLHF)

ここまでの流れ

これまでのRLHFプロセスと、次のステップ(報酬モデル)を示す矢印。

人間のフィードバックによる強化学習(RLHF)

報酬モデルとは?

 

  AIモデルから出力へ矢印が伸びる図。

人間のフィードバックによる強化学習(RLHF)

報酬モデルとは?

  • モデルエージェントを指示する
  • エージェントモデルを評価し、報酬を最大化する

報酬スキームで指示されたAIモデルとエージェント、出力への矢印を示す図。

人間のフィードバックによる強化学習(RLHF)

RewardTrainerの使用

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# Load pre-trained model and tokenizer
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# Load dataset in the required format dataset = load_dataset("path/to/dataset")
人間のフィードバックによる強化学習(RLHF)

報酬モデルの学習

# Define training arguments
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
人間のフィードバックによる強化学習(RLHF)

報酬モデルの学習

# Initialize the RewardTrainer
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# Train the reward model
trainer.train()
人間のフィードバックによる強化学習(RLHF)

Passons à la pratique !

人間のフィードバックによる強化学習(RLHF)

Preparing Video For Download...