मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
Mina Parham
AI Engineer




from trl import RewardTrainer, RewardConfigfrom transformers import AutoModelForSequenceClassification, AutoTokenizerfrom datasets import load_dataset
# प्री-ट्रेन्ड मॉडल और टोकनाइज़र लोड करें model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1) tokenizer = AutoTokenizer.from_pretrained("gpt2")# ज़रूरी फॉर्मेट में डेटासेट लोड करें dataset = load_dataset("path/to/dataset")
# ट्रेनिंग आर्ग्यूमेंट्स परिभाषित करें training_args = RewardConfig(output_dir="path/to/output/dir",per_device_train_batch_size=8, per_device_eval_batch_size=8,num_train_epochs=3,learning_rate=1e-3)
# RewardTrainer इनिशियलाइज़ करें
trainer = RewardTrainer(
model=model,
args=training_args,
train_dataset=dataset["train"],
eval_dataset=dataset["validation"],
tokenizer=tokenizer,
)
# रिवॉर्ड मॉडल को ट्रेन करें
trainer.train()
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)