Khám phá mô hình thưởng

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Quy trình đến nay

Sơ đồ minh họa phần quy trình RLHF đã học đến lúc này.

Reinforcement Learning from Human Feedback (RLHF)

Quy trình đến nay

Sơ đồ minh họa phần quy trình RLHF đã học và mũi tên chỉ bước tiếp theo: mô hình thưởng.

Reinforcement Learning from Human Feedback (RLHF)

Mô hình thưởng là gì?

 

  Sơ đồ hiển thị một mô hình AI với mũi tên trỏ đến đầu ra.

Reinforcement Learning from Human Feedback (RLHF)

Mô hình thưởng là gì?

  • Mô hình cung cấp thông tin cho tác tử
  • Tác tử đánh giá mô hình để tối đa hóa phần thưởng

Sơ đồ hiển thị mô hình AI và tác tử được dẫn dắt bởi cơ chế thưởng với mũi tên trỏ đến đầu ra.

Reinforcement Learning from Human Feedback (RLHF)

Dùng RewardTrainer

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# Load pre-trained model and tokenizer
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# Load dataset in the required format dataset = load_dataset("path/to/dataset")
Reinforcement Learning from Human Feedback (RLHF)

Huấn luyện mô hình thưởng

# Define training arguments
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
Reinforcement Learning from Human Feedback (RLHF)

Huấn luyện mô hình thưởng

# Initialize the RewardTrainer
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# Train the reward model
trainer.train()
Reinforcement Learning from Human Feedback (RLHF)

Ayo berlatih!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...