मॉडल मेट्रिक्स और समायोजन

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

रेफरेंस मॉडल क्यों उपयोग करें?

  • अर्थहीन आउटपुट

इमोजी की एक श्रृंखला.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

मॉडल आउटपुट जाँचना

RLHF प्रक्रिया का आरेख जिसमें प्रतिक्रिया की जाँच है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

समाधान: KL divergence

KL divergence के साथ RLHF प्रक्रिया का आरेख.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

समाधान: KL divergence

  • Penalty को reward model में जोड़ा जाता है
  • यदि आउटपुट असंबद्ध हो तो penalty मॉडल को redirect करती है
  • KL divergence वर्तमान और reward model की तुलना करता है

तराजू का एक आइकन.

  • 0 और 10 के बीच, और कभी नकारात्मक नहीं
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पैरामीटर समायोजित करना

generation_kwargs = {

"min_length": -1, # don't ignore the EOS token
"top_k": 0.0, # no top-k sampling
"top_p": 1.0, "do_sample": True, "pad_token_id": tokenizer.eos_token_id, "max_new_tokens": 32}

 

  • Parameters policy model को पास किए जाते हैं
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

reward model जाँचें

  • reward model जाँचना

  • आउटपुट (reward) जाँचना

reward_model_results.head()
|ID | Comment                                     |Sentiment |Reward|
|---|---------------------------------------------|----------|------|
| 1 | This event was lit! So much fun!            | Positive |  0.9 |
| 2 | Terrible experience, never attending again. | Negative | -0.8 |
| 3 | It was okay, nothing extraordinary.         | Neutral  |  0.2 |
| 4 | The event was poorly organized and chaotic. | Negative | -0.85|
| 5 | Had an amazing time with great people!      | Positive |  0.95|
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

reward model जाँचें

  • 👍 👎 चरम केस जाँचें
    extreme_positive = reward_model_results[reward_model_results['Reward'] >= 0.9]
    extreme_negative = reward_model_results[reward_model_results['Reward'] <= -0.8]
    
  • 🧘 संतुलित डेटासेट सुनिश्चित करें

    sentiment_distribution = reward_model_results['Sentiment'].value_counts()
    
  • 📊 reward model को normalize करें

    from sklearn.preprocessing import MinMaxScaler
    scaler = MinMaxScaler(feature_range=(-1, 1))
    scaler.fit_transform(reward_model_results[['Reward']])
    
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...