RLHF परिचय

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

कोर्स में आपका स्वागत है!

 

  • प्रशिक्षक: Mina Parham

 

  • AI इंजीनियर
  • Large Language Models (LLMs)
  • Reinforcement Learning from Human Feedback (RLHF)

 

  • विषय: Reinforcement Learning from Human Feedback (RLHF)

एक डायग्राम जो एक AI मॉडल को दिखाता है, जिसमें एक अतिरिक्त कदम पर मानव शामिल है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

कोर्स में आपका स्वागत है!

 

  • प्रशिक्षक: Mina Parham

 

  • AI इंजीनियर
  • Large Language Models (LLMs)
  • Reinforcement Learning from Human Feedback (RLHF)

 

  • विषय: Reinforcement Learning from Human Feedback (RLHF)

एक डायग्राम जिसमें AI मॉडल में मानव का एक अतिरिक्त कदम शामिल है, जिससे बेहतर परिणाम मिलते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Reinforcement learning पुनरावलोकन

एक डायग्राम जिसमें एजेंट, एक्शन और रिवॉर्ड पॉलिसी के आइकन चक्र में दिखते हैं, जो रिइनफोर्समेंट लर्निंग की प्रक्रिया दर्शाते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Reinforcement learning पुनरावलोकन

एक डायग्राम जिसमें एजेंट, एक्शन और रिवॉर्ड पॉलिसी के आइकन चक्र में दिखते हैं, जो रिइनफोर्समेंट लर्निंग की प्रक्रिया दर्शाते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Reinforcement learning पुनरावलोकन

एक डायग्राम जिसमें एजेंट, एक्शन और रिवॉर्ड पॉलिसी के आइकन चक्र में दिखते हैं, जो रिइनफोर्समेंट लर्निंग की प्रक्रिया दर्शाते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Reinforcement learning पुनरावलोकन

एक डायग्राम जिसमें एजेंट, एक्शन और रिवॉर्ड पॉलिसी के आइकन चक्र में दिखते हैं, जो रिइनफोर्समेंट लर्निंग की प्रक्रिया दर्शाते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RL से RLHF तक

 

  एक डायग्राम जिसमें LLM, टेक्स्ट आउटपुट और मानव मूल्यांकनकर्ता के आइकन हैं, जो मानव फीडबैक से रिइनफोर्समेंट लर्निंग के चक्र का हिस्सा दिखाते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RL से RLHF तक

 

  एक डायग्राम जिसमें LLM, टेक्स्ट आउटपुट और मानव मूल्यांकनकर्ता के आइकन हैं, जो मानव फीडबैक से रिइनफोर्समेंट लर्निंग के चक्र का हिस्सा दिखाते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RL से RLHF तक

  • Reward model का प्रशिक्षण
  • मानव प्राथमिकताओं के अनुरूप एलाइनमेंट

एक डायग्राम जिसमें LLM, टेक्स्ट आउटपुट और मानव मूल्यांकनकर्ता के आइकन हैं, जो मानव फीडबैक से रिइनफोर्समेंट लर्निंग के चक्र का हिस्सा दिखाते हैं.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RLHF में LLM फाइन-ट्यूनिंग

 

एक बड़े लैंग्वेज मॉडल का आइकन.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RLHF में LLM फाइन-ट्यूनिंग

  • प्रारंभिक LLM का प्रशिक्षण

एक बड़े लैंग्वेज मॉडल का आइकन, जिसे इनपुट डेटासेट से फाइन-ट्यून किया गया है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पूरा RLHF प्रोसेस

एक प्रॉम्प्ट: "Who wrote Romeo and Juliet" जो LLM में जा रहा है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पूरा RLHF प्रोसेस

एक प्रॉम्प्ट: "Who wrote Romeo and Juliet" और LLM का जवाब: "a 16th Century author".

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पूरा RLHF प्रोसेस

एक प्रॉम्प्ट: "Who wrote Romeo and Juliet" और LLM का जवाब: "a 16th Century author", साथ में एक अतिरिक्त मॉडल, पॉलिसी मॉडल, को वही प्रॉम्प्ट मिल रहा है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पूरा RLHF प्रोसेस

एक प्रॉम्प्ट: "Who wrote Romeo and Juliet" और LLM का जवाब: "a 16th Century author", साथ में एक अतिरिक्त पॉलिसी मॉडल को प्रॉम्प्ट मिल रहा है और उसे एक रिवॉर्ड मॉडल से प्रशिक्षित किया जा रहा है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पूरा RLHF प्रोसेस

एक प्रॉम्प्ट: "Who wrote Romeo and Juliet" और LLM का जवाब: "a 16th Century author", तथा रिवॉर्ड मॉडल से प्रशिक्षित पॉलिसी मॉडल का जवाब: "William Shakespeare".

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पूरा RLHF प्रोसेस

एक प्रॉम्प्ट: "Who wrote Romeo and Juliet" और LLM का जवाब: "a 16th Century author", तथा रिवॉर्ड मॉडल से प्रशिक्षित पॉलिसी मॉडल का जवाब: "William Shakespeare", और दोनों परिणामों के बीच जाँच.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RLHF-ट्यून किए गए LLMs के साथ इंटरैक्ट करना

  • Hugging Face पर प्री-ट्रेंड RLHF मॉडल्स 🤗
from transformers import pipeline

text_generator = pipeline('text-generation', model='lvwerra/gpt2-imdb-pos-v2')
# Provide a review prompt review_prompt = "This is definitely a" # Generate the continuation output = text_generator(review_prompt, max_length=50) #Print the generated text print(output[0]['generated_text'])
This is definitely a crucial improvement.
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

RLHF-ट्यून किए गए LLMs के साथ इंटरैक्ट करना

from transformers import pipeline, AutoModelForSequenceClassification, AutoTokenizer


# Instantiate the pre-trained model and tokenizer model = AutoModelForSequenceClassification.from_pretrained("lvwerra/distilbert-imdb") tokenizer = AutoTokenizer.from_pretrained("lvwerra/distilbert-imdb")
# Use pipeline to create the sentiment analyzer sentiment_analyzer = pipeline('sentiment-analysis', model=model, tokenizer=tokenizer) # Pass the text to the sentiment analyzer and print the result sentiment = sentiment_analyzer("This is definitely a crucial improvement.")
print(f"Sentiment Analysis Result: {sentiment}")
positive
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...