रिवॉर्ड मॉडल्स पर नज़र

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

अब तक की प्रक्रिया

अब तक कवर किए गए RLHF प्रोसेस के हिस्से का डायग्राम.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अब तक की प्रक्रिया

अब तक कवर किए गए RLHF प्रोसेस का हिस्सा, और अगले स्टेप (रिवॉर्ड मॉडल्स) की ओर इशारा करता तीर.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

रिवॉर्ड मॉडल क्या है?

 

  एक डायग्राम जिसमें AI मॉडल से आउटपुट की ओर तीर है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

रिवॉर्ड मॉडल क्या है?

  • मॉडल एजेंट को सूचित करता है
  • एजेंट रिवॉर्ड्स अधिकतम करने के लिए मॉडल का मूल्यांकन करता है

एक डायग्राम: रिवॉर्ड स्कीम से सूचित एजेंट और AI मॉडल, आउटपुट की ओर तीर.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

रिवॉर्ड ट्रेनर का उपयोग

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# प्री-ट्रेन्ड मॉडल और टोकनाइज़र लोड करें
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# ज़रूरी फॉर्मेट में डेटासेट लोड करें dataset = load_dataset("path/to/dataset")
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

रिवॉर्ड मॉडल ट्रेन करना

# ट्रेनिंग आर्ग्यूमेंट्स परिभाषित करें
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

रिवॉर्ड मॉडल ट्रेन करना

# RewardTrainer इनिशियलाइज़ करें
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# रिवॉर्ड मॉडल को ट्रेन करें
trainer.train()
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...