Pre-trained LLMs का अन्वेषण

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Mina Parham

AI Engineer

Fine-tuning का महत्व

RLHF प्रक्रिया दर्शाता एक आरेख.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Fine-tuning का महत्व

इनपुट और आउटपुट के साथ एक LLM दर्शाता आरेख.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

LLM को fine-tune करने की चरण-दर-चरण गाइड

ट्वीट की भावना पहचानने के लिए प्रशिक्षित LLM का एक आइकन.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

LLM को fine-tune करने की चरण-दर-चरण गाइड

ट्वीट की भावना पहचानने के लिए प्रशिक्षित LLM का आइकन गलत आउटपुट देता हुआ.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

LLM को fine-tune करने की चरण-दर-चरण गाइड

ट्वीट भावना पहचानने के लिए LLM का आइकन, बड़े डेटासेट पर pre-trained.

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

चरण 1: उपयोग के लिए डेटा लोड करें

from datasets import load_dataset
import pandas as pd

# `load_dataset` simplifies loading and preprocessing datasets from various sources
# It provides easy access to a wide range of datasets with minimal setup
dataset = load_dataset("mteb/tweet_sentiment_extraction")
df = pd.DataFrame(dataset['train'])
    id               text                                        label   label_text
0   cb774db0d1       I'd have responded, if I were going         1       neutral
1   549e992a42       Sooo SAD I will miss you in San Diego!!!    0       negative
2   08ac60f138       my boss is bullying me...                   0       negative
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

चरण 2: एक pre-trained मॉडल चुनें

from transformers import AutoModelForCausalLM

# AutoModelForCausalLM simplifies loading and switching models
model = AutoModelForCausalLM.from_pretrained("openai-gpt")

 

  • Causal models: पिछले tokens आगे वाले को "cause" करते हैं
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

चरण 3: tokenizer

from transformers import AutoTokenizer

# `AutoTokenizer` loads the correct tokenizer for the specified model
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
tokenizer.add_special_tokens({'pad_token': '[PAD]'})
model.resize_token_embeddings(len(tokenizer))

 

  • Padding: समान आकार के text batches के लिए
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

चरण 3: tokenizer

def tokenize_function(examples):
    tokenized = tokenizer(examples["content"], padding="max_length", truncation=True) 
    return tokenized

tokenized_datasets = dataset.map(tokenize_function, batched=True)

 

  • Batched पैरामीटर: तेज प्रोसेसिंग के लिए
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

चरण 4: Trainer विधि से fine-tune करें

training_args = TrainingArguments(
   output_dir="test_trainer",
   per_device_train_batch_size=1,
   per_device_eval_batch_size=1,  
   gradient_accumulation_steps=4)
trainer = Trainer(
   model=model,
   args=training_args,
   train_dataset=tokenized_dataset["train"],
   eval_dataset=tokenized_dataset["test"])
trainer.train()
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

अभ्यास करते हैं!

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

Preparing Video For Download...