Đánh giá mô hình RLHF

Reinforcement Learning from Human Feedback (RLHF)

Mina Parham

AI Engineer

Chỉ số tự động hóa

 

  • Nhiệm vụ phân loại: Accuracy, F1
classification_results.head(3)
| ID | Feedback_Text                         | True_Category | Predicted_Category |
|----|---------------------------------------|---------------|--------------------|
| 1  | "Arrived on time and works great."    | Positive      | Positive           |
| 2  | "I had issues with customer service." | Negative      | Neutral            |
| 3  | "The website is easy to navigate."    | Positive      | Positive           |
Reinforcement Learning from Human Feedback (RLHF)

Chỉ số tự động hóa

 

  • Sinh văn bản, tóm tắt: ROUGE, BLEU
text_generation.head(3)
| ID | Prompt               | True_Completion  | Pred_Completion   |
|----|----------------------|------------------|-------------------|
| 1  | "Customer service"   | "can help you."  | "will assist."    |
| 2  | "To get a refund,"   | "contact us."    | "reach out."      |
| 3  | "Support team is"    | "here 24/7."     | "available 24/7." |
Reinforcement Learning from Human Feedback (RLHF)

Chỉ số tự động hóa

 

 

Câu tham chiếu:

  • RLHF cải thiện việc căn chỉnh mô hình với giá trị của con người.

 

 

Điểm ROUGE: 0.83

 

 

Câu so sánh:

  • RLHF căn chỉnh mô hình với giá trị của con người.
Reinforcement Learning from Human Feedback (RLHF)

Đường cong hiện vật

config = PPOConfig(
    model_name="lvwerra/gpt2-imdb",learning_rate=1.41e-5, log_with="wandb")
import wandb
wandb.init()

Ảnh chụp màn hình đầu ra terminal trong Weights and Biases.

Reinforcement Learning from Human Feedback (RLHF)

Đường cong hiện vật

  • Phần thưởng tăng khi mô hình học.

Một đường cong xu hướng tăng của phần thưởng, cho thấy mô hình đang cải thiện.

  • Đường cong KL nên tăng dần.

Một đường cong cho thấy xu hướng tăng dần của mất mát KL.

Reinforcement Learning from Human Feedback (RLHF)

Đánh giá lấy con người làm trung tâm

  • Đánh giá bởi con người: phán đoán chủ quan hoặc hiểu sâu bối cảnh

Một người đánh giá đang làm việc trên laptop.

  • Đánh giá bằng mô hình: khả năng mở rộng và nhất quán

Một robot với các ô thoại đại diện cho mô hình đánh giá.

Reinforcement Learning from Human Feedback (RLHF)

Ayo berlatih!

Reinforcement Learning from Human Feedback (RLHF)

Preparing Video For Download...