उच्च-गुणवत्ता फीडबैक एकत्र करने के तरीके

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

उच्च-गुणवत्ता फीडबैक एकत्र करने के तरीके

रिवार्ड मॉडल के बिना RLHF की प्रक्रिया।

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

उच्च-गुणवत्ता फीडबैक एकत्र करने के तरीके

पूरा RLHF प्रोसेस।

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पेयरवाइज़ तुलना

  • दो विकल्पों में चुनना:
  • फायदे: सरल, सहज, पक्षपात घटाता है
  • चुनौतियाँ: प्रति लेबल कम जानकारी मिलती है
  • उदाहरण: मूवी A बनाम मूवी B: "आप किसे पसंद करते हैं?

एक व्यक्ति के हाथों में दो तख्तियाँ: एक पर 'Accepted' आइकन और दूसरी पर 'Rejected' आइकन।

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पेयरवाइज़ तुलना

def evaluate_responses(responses_A, responses_B):
    wins_A, wins_B = 0, 0
    for (response_A, score_A), (response_B, score_B) in zip(responses_A, responses_B):
        if score_A > score_B:
            wins_A += 1
        else:
            wins_B += 1
    success_rate_A = (wins_A / len(responses_A)) * 100
    success_rate_B = (wins_B / len(responses_B)) * 100
    return success_rate_A, success_rate_B
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

रेटिंग्स

  • एक स्केल पर स्कोर देना:

  • फायदे: अधिक विस्तृत फीडबैक देता है

  • चुनौतियाँ: पक्षपात की आशंका, स्केल असंगत हो सकते हैं
  • उदाहरण:
      मूवी A: 4/5
      मूवी B: 3/5
    

एक चित्रण: एक महिला हाथ में सितारा लिए, उसके चारों ओर रेटिंग आइकन।

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

मनोवैज्ञानिक कारक

  • संज्ञानात्मक पक्षपात:
    • Framing Effect: सवाल कैसे रखा गया है, उससे जवाब प्रभावित हो सकते हैं
    • Serial Position Effect: विकल्पों के क्रम से निर्णय बदल सकते हैं
    • Anchoring: पहले की जानकारी वर्तमान फैसलों को झुका देती है

एक व्यक्ति आँखों से वर्ग देख रहा है पर दिमाग में उसे आयत समझ रहा है — पक्षपात की अवधारणा दर्शाने हेतु।

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

उच्च-गुणवत्ता फीडबैक जुटाने के दिशानिर्देश

 

  • संज्ञानात्मक लोड: थके हुए यूज़र, असंगत फीडबैक
  • सवाल सावधानी से लिखें
    • संज्ञानात्मक लोड के जोखिम घटाने के लिए।
  • क्वेरी का क्रम रैंडम करें
    • एंकरिंग और फ्रेमिंग से होने वाले पक्षपात को कम करने के लिए
  • विविध डेटा जुटाएँ
    • नॉइज़ के असर को घटाने के लिए।

एक पुरुष और महिला फीडबैक और टेक्स्ट्स का विश्लेषण करते हुए।

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...