एडवांस्ड फाइन-ट्यूनिंग

Large Language Models (LLMs) कॉन्सेप्ट्स

Vidhi Chugh

AI strategist and ethicist

हम कहाँ हैं?

प्रोग्रेस इमेज जो दिखाती है कि हम Advanced fine-tuning चरण पर हैं

Large Language Models (LLMs) कॉन्सेप्ट्स

ह्यूमन फ़ीडबैक से रिइनफोर्समेंट लर्निंग

 

  • प्री-ट्रेनिंग

 

  • फाइन-ट्यूनिंग

 

  • ह्यूमन फ़ीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

 

चार लोग इमोजी और सितारों से सकारात्मक फ़ीडबैक दे रहे हैं का चित्रण।

Large Language Models (LLMs) कॉन्सेप्ट्स

प्री-ट्रेनिंग

  • बहुत बड़ा टेक्स्ट डेटा:
    • वेबसाइट्स, किताबें और आर्टिकल्स
    • ट्रांसफ़ॉर्मर आर्किटेक्चर
    • सामान्य भाषा पैटर्न, व्याकरण, और तथ्य सीखता है

 

  • नेक्स्ट-वर्ड प्रेडिक्शन
  • मास्क्ड लैंग्वेज मॉडलिंग

LLMs बनाने के लिए प्री-ट्रेनिंग प्रक्रिया

1 Freepik
Large Language Models (LLMs) कॉन्सेप्ट्स

फाइन-ट्यूनिंग

 

  • N-shot ट्रेनिंग

 

  • संबंधित टास्क के लिए छोटा लेबल्ड डेटासेट

फाइन-ट्यूनिंग प्रक्रिया

Large Language Models (LLMs) कॉन्सेप्ट्स

लेकिन, RLHF क्यों?

  • जनरल-पर्पज़ ट्रेनिंग डेटा की क्वालिटी कम होती है
    • नॉइज़
    • एरर्स
    • इनकंसिस्टेंसीज़
    • एक्युरेसी घटती है

कम एक्युरेसी का उदाहरण:

  • ऑनलाइन डिस्कशन फ़ोरम के डेटा पर ट्रेन हुआ
  • अनवैलिएटेड ओपिनियन और फैक्ट्स
  • बाहरी विशेषज्ञ वैलिडेशन चाहिए

 

तीरंदाजी के निशाने पर तीर बुल्सआई से चूके हुए

Large Language Models (LLMs) कॉन्सेप्ट्स

ज़रूरत फाइन-ट्यूनिंग से शुरू होती है

  • प्री-ट्रेनिंग
    • अंतर्निहित भाषा पैटर्न सीखता है
    • संदर्भ-विशिष्ट जटिलताएँ नहीं पकड़ता

 

  • फाइन-ट्यूनिंग
    • क्वालिटी लेबल्ड डेटा से परफॉर्मेंस बेहतर होता है

 

  • यहीं आता है RLHF!
    • ह्यूमन फ़ीडबैक
Large Language Models (LLMs) कॉन्सेप्ट्स

RLHF को सरल करना

 

  • मॉडल आउटपुट की मानव द्वारा समीक्षा
  • फ़ीडबैक के आधार पर मॉडल अपडेट होता है

 

  • स्टेप 1:
    • एक प्रॉम्प्ट रिसीव करता है
    • कई रिस्पॉन्स जनरेट करता है

 

 

एक LLM इनपुट प्रॉम्प्ट लेता है और रिस्पॉन्स जनरेट करता है

Large Language Models (LLMs) कॉन्सेप्ट्स

मानव विशेषज्ञ आता है

 

  • स्टेप 2:
    • मानव विशेषज्ञ इन रिस्पॉन्स चेक करता है
    • क्वालिटी के आधार पर रैंक करता है
      • एक्युरेसी
      • रिलिवेंस
      • कोहेरेंस

LLM के रिस्पॉन्स में मानव वेरिफिकेशन जोड़ना

Large Language Models (LLMs) कॉन्सेप्ट्स

फ़ीडबैक का समय

  • स्टेप 3:
    • विशेषज्ञ की रैंकिंग से सीखता है
    • ताकि भविष्य में उनके प्रेफ़रेंसेज़ से रिस्पॉन्स अलाइन हों

 

  • और यह चलता रहता है!
    • रिस्पॉन्स जनरेट करता रहता है
    • विशेषज्ञ की रैंकिंग लेता है
    • लर्निंग एडजस्ट करता है

 

 

मानव रिस्पॉन्स LLM को वापस दिया जाता है

Large Language Models (LLMs) कॉन्सेप्ट्स

रीकैप

  • प्री-ट्रेनिंग सामान्य भाषा ज्ञान सीखने के लिए

 

  • फाइन-ट्यूनिंग विशिष्ट टास्क के लिए

 

  • RLHF तकनीकें, ह्यूमन फ़ीडबैक से फाइन-ट्यूनिंग बढ़ाने हेतु

 

  • संयोजन बेहद प्रभावी है!
Large Language Models (LLMs) कॉन्सेप्ट्स

LLM को पूरा करना

पूरी LLM ट्रेनिंग प्रक्रिया

Large Language Models (LLMs) कॉन्सेप्ट्स

अभ्यास करते हैं!

Large Language Models (LLMs) कॉन्सेप्ट्स

Preparing Video For Download...