สำรวจ Reward Model

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

กระบวนการที่ผ่านมา

ไดอะแกรมแสดงส่วนของกระบวนการ RLHF ที่ครอบคลุมไปแล้ว

Reinforcement Learning from Human Feedback (RLHF)

กระบวนการที่ผ่านมา

ไดอะแกรมแสดงส่วนของกระบวนการ RLHF ที่ผ่านมา และลูกศรชี้ไปยังขั้นตอนถัดไป: reward model

Reinforcement Learning from Human Feedback (RLHF)

Reward Model คืออะไร?

 

  ไดอะแกรมแสดง AI model พร้อมลูกศรชี้ไปยัง output

Reinforcement Learning from Human Feedback (RLHF)

Reward Model คืออะไร?

  • Model แจ้งข้อมูลให้ agent
  • Agent ประเมิน model เพื่อเพิ่ม reward สูงสุด

ไดอะแกรมแสดง AI model และ agent ที่ได้รับข้อมูลจาก reward scheme พร้อมลูกศรชี้ไปยัง output

Reinforcement Learning from Human Feedback (RLHF)

การใช้ Reward Trainer

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# Load pre-trained model and tokenizer
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# Load dataset in the required format dataset = load_dataset("path/to/dataset")
Reinforcement Learning from Human Feedback (RLHF)

การฝึก Reward Model

# Define training arguments
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
Reinforcement Learning from Human Feedback (RLHF)

การฝึก Reward Model

# Initialize the RewardTrainer
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# Train the reward model
trainer.train()
Reinforcement Learning from Human Feedback (RLHF)

มาฝึกกันเถอะ!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...