RLHF मॉडलों का मूल्यांकन

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

Automation मेट्रिक्स

 

  • Classification कार्य: Accuracy, F1 score
classification_results.head(3)
| ID | Feedback_Text                         | True_Category | Predicted_Category |
|----|---------------------------------------|---------------|--------------------|
| 1  | "Arrived on time and works great."    | Positive      | Positive           |
| 2  | "I had issues with customer service." | Negative      | Neutral            |
| 3  | "The website is easy to navigate."    | Positive      | Positive           |
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Automation मेट्रिक्स

 

  • Text generation, summarization: ROUGE, BLEU
text_generation.head(3)
| ID | Prompt               | True_Completion  | Pred_Completion   |
|----|----------------------|------------------|-------------------|
| 1  | "Customer service"   | "can help you."  | "will assist."    |
| 2  | "To get a refund,"   | "contact us."    | "reach out."      |
| 3  | "Support team is"    | "here 24/7."     | "available 24/7." |
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Automation मेट्रिक्स

 

 

संदर्भ कथन:

  • RLHF model को मानवीय मूल्यों से बेहतर align करता है.

 

 

ROUGE score: 0.83

 

 

तुलना हेतु कथन:

  • RLHF models को human values से align करता है.
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

आर्टिफैक्ट कर्व्स

config = PPOConfig(
    model_name="lvwerra/gpt2-imdb",learning_rate=1.41e-5, log_with="wandb")
import wandb
wandb.init()

Weights and Biases के टर्मिनल आउटपुट का स्क्रीनशॉट.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

आर्टिफैक्ट कर्व्स

  • मॉडल सीखते समय रिवॉर्ड बढ़ता है.

रिवॉर्ड में ऊपर जाता ट्रेंड दिखाने वाली कर्व, जो मॉडल के सुधरने को दर्शाती है.

  • KL कर्व धीरे-धीरे बढ़नी चाहिए.

KL loss में क्रमिक बढ़त दिखाने वाली कर्व.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

मानव-केंद्रित मूल्यांकन

  • मानव मूल्यांकन: व्यक्तिपरक निर्णय या संदर्भ की गहरी समझ

लैपटॉप पर काम करती एक मानव मूल्यांकनकर्ता.

  • मॉडल-आधारित मूल्यांकन: स्केलेबिलिटी और सुसंगतता

स्पीच बबल्स वाला एक रोबोट, जो मॉडल इवैल्युएटर दर्शाता है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...