RLHF 모델 평가

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

자동화 지표

 

  • 분류 과제: 정확도, F1 점수
classification_results.head(3)
| ID | Feedback_Text                         | True_Category | Predicted_Category |
|----|---------------------------------------|---------------|--------------------|
| 1  | "Arrived on time and works great."    | Positive      | Positive           |
| 2  | "I had issues with customer service." | Negative      | Neutral            |
| 3  | "The website is easy to navigate."    | Positive      | Positive           |
Reinforcement Learning from Human Feedback (RLHF)

자동화 지표

 

  • 텍스트 생성, 요약: ROUGE, BLEU
text_generation.head(3)
| ID | Prompt               | True_Completion  | Pred_Completion   |
|----|----------------------|------------------|-------------------|
| 1  | "Customer service"   | "can help you."  | "will assist."    |
| 2  | "To get a refund,"   | "contact us."    | "reach out."      |
| 3  | "Support team is"    | "here 24/7."     | "available 24/7." |
Reinforcement Learning from Human Feedback (RLHF)

자동화 지표

 

 

기준 문장:

  • RLHF모델인간 가치에 맞게 정렬합니다.

 

 

ROUGE 점수: 0.83

 

 

비교할 문장:

  • RLHF는 모델을 인간 가치에 맞춥니다.
Reinforcement Learning from Human Feedback (RLHF)

아티팩트 곡선

config = PPOConfig(
    model_name="lvwerra/gpt2-imdb",learning_rate=1.41e-5, log_with="wandb")
import wandb
wandb.init()

Weights and Biases의 터미널 출력 스크린샷.

Reinforcement Learning from Human Feedback (RLHF)

아티팩트 곡선

  • 학습이 진행될수록 보상이 증가합니다.

보상이 상승 추세를 보여 모델이 개선되고 있음을 나타내는 곡선.

  • KL 곡선은 점진적으로 증가해야 합니다.

KL 손실이 완만히 증가하는 추세를 보이는 곡선.

Reinforcement Learning from Human Feedback (RLHF)

인간 중심 평가

  • 인간 평가: 주관적 판단 또는 맥락에 대한 깊은 이해

노트북으로 평가하는 사람.

  • 모델 평가: 확장성과 일관성

말풍선을 가진 로봇으로 모델 평가자를 표현.

Reinforcement Learning from Human Feedback (RLHF)

연습해 봅시다!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...