विविध फीडबैक स्रोत शामिल करना

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

बेहतर मॉडल जनरलाइज़ेशन

 

  • अलग-अलग दृष्टिकोण और प्रसंग दर्शाएँ
  • पसंद और मूल्यों का सामान्यीकरण करें

अलग-अलग विचारों को दर्शाते कॉलआउट बबल्स के साथ हाथों की छवि.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

कम हुआ बायस

  • व्यक्तिगत पक्षपात घटाएँ
  • अधिक संतुलित और निष्पक्ष मॉडल आउटपुट बनाएँ

एक बार चार्ट जो पुरुष समूह-पक्षपाती डेटासेट और पुरुष-महिला समान वितरण वाले संतुलित डेटासेट का फर्क दिखाता है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

मानव मूल्यों से बेहतर संरेखन

  • जटिल मानव पसंद
  • संस्कृतियाँ और पृष्ठभूमियाँ दर्शाई गईं

विविध लोगों के समूह को दर्शाते आइकन

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

बेहतर अनुकूलन क्षमता

  • मॉडल व्यापक ज़रूरतों और पसंदों पर प्रतिक्रिया दे
  • अलग-अलग दृष्टिकोण दर्शाएँ

एक आइकन जिसमें व्यक्ति और अलग-अलग दृष्टिकोण दिखाते इमोजी हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

बढ़ी हुई मजबूती

  • अलग-अलग तरह के इनपुट पर सुदृढ़
  • प्रदर्शन में सुधार

एक आरेख जो अलग-अलग इनपुट और प्रसंगों से गुणवत्ता में सुधार दिखाता है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

कई स्रोतों से पसंद डेटा एकीकृत करना

पसंद डेटा preference_df जिनके स्रोत हैं 'Journalist', 'Social Media Influencer', और 'Marketing Professional':

तीन अलग-अलग स्रोतों से संरचित डेटा दिखाने वाली तालिका

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Majority voting

यह सैंपल डेटा 'id' से group करके आसानी से एकीकृत हो सकता है:

df_majority = preference_df.groupby(['id']).apply(majority_vote)

फिर, majority voting का उपयोग करें:

from collections import Counter

def majority_vote(df):
    votes = Counter(zip(df['chosen'], df['rejected'])) 
    return max(votes, key=votes.get)
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अविश्वसनीय पसंद डेटा स्रोत

वही तीन विशेषज्ञों वाला पसंद डेटा preference_df2:

तीन अलग-अलग स्रोतों से संरचित डेटा दिखाने वाली तालिका

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अविश्वसनीय पसंद डेटा स्रोत

  • preference_df2 की rows पर iterate करके अविश्वसनीय स्रोत पहचानें:
df_majority = preference_df2.groupby('id').apply(majority_vote)

disagreements = {source: 0 for source in preference_df2['source'].unique()}
for _, row in preference_df2.iterrows(): if (row['chosen'], row['rejected']) != df_majority[row['id']]: disagreements[row['source']] += 1
detect_unreliable_source = max(disagreements, key=disagreements.get)
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...