PPO के साथ प्रशिक्षण

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

Reinforcement learning से फाइन-ट्यूनिंग

RLHF प्रक्रिया में प्रारंभिक LLM और रिवार्ड मॉडल.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Reinforcement learning से फाइन-ट्यूनिंग

पूरी RLHF प्रक्रिया.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

PPO से भाषा मॉडल की फाइन-ट्यूनिंग

 

एक क्वेरी जिसे LLM को दिया गया है ताकि वह उसके आधार पर कंटिन्यूएशन जनरेट करे.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

PPO से भाषा मॉडल की फाइन-ट्यूनिंग

 

एक क्वेरी जिसे LLM को दिया गया है, जो क्वेरी को पूरा करता है: 'we're half way there, oh livin' on a prayer'.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

PPO से भाषा मॉडल की फाइन-ट्यूनिंग

 

एक क्वेरी जिसे LLM को दिया गया है, जो क्वेरी को पूरा करता है: 'we're half way there, oh livin' on a prayer', और दूसरा LLM उस कंप्लीशन का आकलन करता है.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

PPO से भाषा मॉडल की फाइन-ट्यूनिंग

  • PPO: मॉडल में क्रमिक समायोजन
  • फीडबैक पर ओवरफिटिंग से बचाता है

एल्गोरिदम के धीमे सुधार को दर्शाते रोबोट और घोंघा.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

TRL के साथ PPOTrainer लागू करना

from trl import PPOConfig
config = PPOConfig(model_name="gpt2",learning_rate=1.4e-5)
from trl import AutoModelForCausalLMWithValueHead
model = AutoModelForCausalLMWithValueHead.from_pretrained(config.model_name)
tokenizer = AutoTokenizer.from_pretrained(config.model_name)
from trl import PPOTrainer
ppo_trainer = PPOTrainer(model=model,config=config,dataset=dataset,
                         tokenizer=tokenizer)
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

ट्रेनिंग लूप शुरू करना

for epoch in tqdm(range(10), "epoch: "):


for batch in tqdm(ppo_trainer.dataloader):
# Get responses response_tensors = ppo_trainer.generate(batch["input_ids"])
batch["response"] = [tokenizer.decode(r.squeeze()) for r in response_tensors]
# Compute reward score texts = [q + r for q, r in zip(batch["query"], batch["response"])]
rewards = reward_model(texts)
stats = ppo_trainer.step(query_tensors, response_tensors, rewards) ppo_trainer.log_stats(stats, batch, rewards)
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...