Modele nagród – przegląd

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Mina Parham

AI Engineer

Dotychczasowy proces

Diagram przedstawiający dotychczas omówioną część procesu RLHF.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Dotychczasowy proces

Diagram przedstawiający dotychczasową część procesu RLHF oraz strzałkę wskazującą na kolejny krok: modele nagród.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czym jest model nagród?

 

  Diagram przedstawiający model AI ze strzałką wskazującą na dane wyjściowe.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czym jest model nagród?

  • Model informuje agenta
  • Agent ocenia model, aby maksymalizować nagrody

Diagram przedstawiający model AI i agenta kierowanego schematem nagród ze strzałką wskazującą na dane wyjściowe.

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Korzystanie z trenera nagród

from trl import RewardTrainer, RewardConfig

from transformers import AutoModelForSequenceClassification, AutoTokenizer
from datasets import load_dataset
# Load pre-trained model and tokenizer
model = AutoModelForSequenceClassification.from_pretrained("gpt2", num_labels=1)
tokenizer = AutoTokenizer.from_pretrained("gpt2")

# Load dataset in the required format dataset = load_dataset("path/to/dataset")
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Trenowanie modelu nagród

# Define training arguments
training_args = RewardConfig(

output_dir="path/to/output/dir",
per_device_train_batch_size=8, per_device_eval_batch_size=8,
num_train_epochs=3,
learning_rate=1e-3
)
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Trenowanie modelu nagród

# Initialize the RewardTrainer
trainer = RewardTrainer(
    model=model,
    args=training_args,
    train_dataset=dataset["train"],
    eval_dataset=dataset["validation"],
    tokenizer=tokenizer,
)
# Train the reward model
trainer.train()
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Czas na ćwiczenia!

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Preparing Video For Download...