모델 지표와 조정

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

왜 기준 모델을 사용할까요?

  • 무의미한 출력

이모지 모음.

Reinforcement Learning from Human Feedback (RLHF)

모델 출력 점검

응답 검사를 포함한 RLHF 프로세스 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

해결: KL 발산

KL 발산을 포함한 RLHF 프로세스 다이어그램.

Reinforcement Learning from Human Feedback (RLHF)

해결: KL 발산

  • 보상 모델에 페널티를 추가합니다
  • 관련 없는 출력 시 모델을 페널티로 교정합니다
  • KL 발산으로 현재 모델과 보상 모델을 비교합니다

저울 아이콘.

  • 값은 0~10, 음수 없음
Reinforcement Learning from Human Feedback (RLHF)

매개변수 조정

generation_kwargs = {

"min_length": -1, # don't ignore the EOS token
"top_k": 0.0, # no top-k sampling
"top_p": 1.0, "do_sample": True, "pad_token_id": tokenizer.eos_token_id, "max_new_tokens": 32}

 

  • 매개변수는 정책 모델에 전달됩니다
Reinforcement Learning from Human Feedback (RLHF)

보상 모델 점검

  • 보상 모델 확인

  • 출력(보상) 확인

reward_model_results.head()
|ID | Comment                                     |Sentiment |Reward|
|---|---------------------------------------------|----------|------|
| 1 | This event was lit! So much fun!            | Positive |  0.9 |
| 2 | Terrible experience, never attending again. | Negative | -0.8 |
| 3 | It was okay, nothing extraordinary.         | Neutral  |  0.2 |
| 4 | The event was poorly organized and chaotic. | Negative | -0.85|
| 5 | Had an amazing time with great people!      | Positive |  0.95|
Reinforcement Learning from Human Feedback (RLHF)

보상 모델 점검

  • 👍 👎 극단 사례 확인
    extreme_positive = reward_model_results[reward_model_results['Reward'] >= 0.9]
    extreme_negative = reward_model_results[reward_model_results['Reward'] <= -0.8]
    
  • 🧘 데이터 균형 보장

    sentiment_distribution = reward_model_results['Sentiment'].value_counts()
    
  • 📊 보상 모델 정규화

    from sklearn.preprocessing import MinMaxScaler
    scaler = MinMaxScaler(feature_range=(-1, 1))
    scaler.fit_transform(reward_model_results[['Reward']])
    
Reinforcement Learning from Human Feedback (RLHF)

Lass uns üben!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...