Chỉ số mô hình và điều chỉnh

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Vì sao dùng mô hình tham chiếu?

  • Đầu ra vô nghĩa

Một chuỗi biểu tượng cảm xúc.

Reinforcement Learning from Human Feedback (RLHF)

Kiểm tra đầu ra mô hình

Sơ đồ quy trình RLHF với bước kiểm tra phản hồi.

Reinforcement Learning from Human Feedback (RLHF)

Giải pháp: KL divergence

Sơ đồ quy trình RLHF với KL divergence.

Reinforcement Learning from Human Feedback (RLHF)

Giải pháp: KL divergence

  • Thêm penalty vào mô hình phần thưởng
  • Penalty điều hướng mô hình khi sinh đầu ra không liên quan
  • KL divergence so sánh mô hình hiện tại và mô hình phần thưởng

Biểu tượng cái cân.

  • Trong khoảng 0 đến 10, và không bao giờ âm
Reinforcement Learning from Human Feedback (RLHF)

Điều chỉnh tham số

generation_kwargs = {

"min_length": -1, # don't ignore the EOS token
"top_k": 0.0, # no top-k sampling
"top_p": 1.0, "do_sample": True, "pad_token_id": tokenizer.eos_token_id, "max_new_tokens": 32}

 

  • Tham số được truyền vào mô hình policy
Reinforcement Learning from Human Feedback (RLHF)

Kiểm tra mô hình phần thưởng

  • Kiểm tra mô hình phần thưởng

  • Kiểm tra đầu ra (phần thưởng)

reward_model_results.head()
|ID | Comment                                     |Sentiment |Reward|
|---|---------------------------------------------|----------|------|
| 1 | This event was lit! So much fun!            | Positive |  0.9 |
| 2 | Terrible experience, never attending again. | Negative | -0.8 |
| 3 | It was okay, nothing extraordinary.         | Neutral  |  0.2 |
| 4 | The event was poorly organized and chaotic. | Negative | -0.85|
| 5 | Had an amazing time with great people!      | Positive |  0.95|
Reinforcement Learning from Human Feedback (RLHF)

Kiểm tra mô hình phần thưởng

  • 👍 👎 Kiểm tra trường hợp cực trị
    extreme_positive = reward_model_results[reward_model_results['Reward'] >= 0.9]
    extreme_negative = reward_model_results[reward_model_results['Reward'] <= -0.8]
    
  • 🧘 Đảm bảo dữ liệu cân bằng

    sentiment_distribution = reward_model_results['Sentiment'].value_counts()
    
  • 📊 Chuẩn hóa mô hình phần thưởng

    from sklearn.preprocessing import MinMaxScaler
    scaler = MinMaxScaler(feature_range=(-1, 1))
    scaler.fit_transform(reward_model_results[['Reward']])
    
Reinforcement Learning from Human Feedback (RLHF)

Ayo berlatih!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...