리워드 모델 살펴보기

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

지금까지의 진행

지금까지 다룬 RLHF 프로세스 부분을 보여주는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

지금까지의 진행

지금까지의 RLHF 프로세스와 다음 단계(리워드 모델)로 가리키는 화살표가 있는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

리워드 모델이란?

 

  AI 모델에서 출력으로 화살표가 향하는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

리워드 모델이란?

  • 모델에이전트를 안내
  • 에이전트보상을 극대화하도록 모델을 평가

리워드 체계로 안내된 모델과 에이전트, 출력으로 향하는 화살표가 있는 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

리워드 트레이너 사용

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# 사전 학습 모델과 토크나이저 로드
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# 요구 형식의 데이터셋 로드 dataset = load_dataset("path/to/dataset")
Reinforcement Learning from Human Feedback (RLHF)

리워드 모델 학습

# 학습 인자 정의
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
Reinforcement Learning from Human Feedback (RLHF)

리워드 모델 학습

# RewardTrainer 초기화
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# 리워드 모델 학습
trainer.train()
Reinforcement Learning from Human Feedback (RLHF)

Let's practice!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...