Gradiëntaccumulatie

Efficiënt AI-modellen trainen met PyTorch

Dennis Lee

Data Engineer, Amazon

Distributed training

 

 

Stroomschema met de cursusthema's: datapreparatie, distributed training, efficiënt trainen en optimizers.

Efficiënt AI-modellen trainen met PyTorch

Efficiënt trainen

 

 

Stroomschema met de cursusthema's: datapreparatie, distributed training, efficiënt trainen en optimizers.

Efficiënt AI-modellen trainen met PyTorch

Efficiënter trainen

 

 

Pictogrammen voor geheugenefficiëntie, communicatie-efficiëntie en rekenefficiëntie.

Efficiënt AI-modellen trainen met PyTorch

Efficiënter trainen

 

 

Pictogrammen voor geheugenefficiëntie, communicatie-efficiëntie en rekenefficiëntie.

Efficiënt AI-modellen trainen met PyTorch

Efficiënter trainen

 

 

Pictogrammen voor geheugenefficiëntie, communicatie-efficiëntie en rekenefficiëntie.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie verbetert geheugenefficiëntie

 

 

Pictogrammen voor geheugenefficiëntie, communicatie-efficiëntie en rekenefficiëntie.

Efficiënt AI-modellen trainen met PyTorch

Het probleem met grote batches

  • Grote batchgrootte: stabiele gradiënten, sneller leren
  • GPU-geheugen beperkt batchgrootte

 

 

Diagram: grote batches geven out-of-memory-fouten; kleinere batches laten training slagen.

Efficiënt AI-modellen trainen met PyTorch

Hoe werkt gradiëntaccumulatie?

Diagram van een grote batch die in kleinere batches is gesplitst.

  • Gradiëntaccumulatie: sommeer gradiënten over kleine batches
  • Train effectief met een grote batch
  • Update parameters na het sommeren

Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

PyTorch, Accelerator en Trainer

Grafiek: gebruiksgemak vs. maatwerk voor PyTorch, Accelerator en Trainer.

Efficiënt AI-modellen trainen met PyTorch

PyTorch, Accelerator en Trainer

Grafiek: gebruiksgemak vs. maatwerk voor PyTorch, Accelerator en Trainer.

Efficiënt AI-modellen trainen met PyTorch

PyTorch, Accelerator en Trainer

Grafiek: gebruiksgemak vs. maatwerk voor PyTorch, Accelerator en Trainer.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met PyTorch

for index, batch in enumerate(dataloader):
    inputs, targets = (batch["input_ids"], 
                       batch["labels"])
    inputs, targets = (inputs.to(device), 
                       targets.to(device))









Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met PyTorch

for index, batch in enumerate(dataloader):
    inputs, targets = (batch["input_ids"], 
                       batch["labels"])
    inputs, targets = (inputs.to(device), 
                       targets.to(device))
    outputs = model(inputs, labels=targets)
    loss = outputs.loss







Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met PyTorch

for index, batch in enumerate(dataloader):
    inputs, targets = (batch["input_ids"], 
                       batch["labels"])
    inputs, targets = (inputs.to(device), 
                       targets.to(device))
    outputs = model(inputs, labels=targets)
    loss = outputs.loss
    loss = loss / gradient_accumulation_steps







Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met PyTorch

for index, batch in enumerate(dataloader):
    inputs, targets = (batch["input_ids"], 
                       batch["labels"])
    inputs, targets = (inputs.to(device), 
                       targets.to(device))
    outputs = model(inputs, labels=targets)
    loss = outputs.loss
    loss = loss / gradient_accumulation_steps
    loss.backward()







Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met PyTorch

for index, batch in enumerate(dataloader):
    inputs, targets = (batch["input_ids"], 
                       batch["labels"])
    inputs, targets = (inputs.to(device), 
                       targets.to(device))
    outputs = model(inputs, labels=targets)
    loss = outputs.loss
    loss = loss / gradient_accumulation_steps
    loss.backward()
    if ((index + 1) 
        % gradient_accumulation_steps == 0):





Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met PyTorch

for index, batch in enumerate(dataloader):
    inputs, targets = (batch["input_ids"], 
                       batch["labels"])
    inputs, targets = (inputs.to(device), 
                       targets.to(device))
    outputs = model(inputs, labels=targets)
    loss = outputs.loss
    loss = loss / gradient_accumulation_steps
    loss.backward()
    if ((index + 1) 
        % gradient_accumulation_steps == 0):
        optimizer.step()
        lr_scheduler.step()
        optimizer.zero_grad()

Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Van PyTorch naar Accelerator

Grafiek: gebruiksgemak vs. maatwerk voor PyTorch, Accelerator en Trainer.

Efficiënt AI-modellen trainen met PyTorch

Van PyTorch naar Accelerator

Grafiek: gebruiksgemak vs. maatwerk voor PyTorch, Accelerator en Trainer.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met Accelerator

accelerator = \
    Accelerator(gradient_accumulation_steps=2)

for index, batch in enumerate(dataloader): inputs, targets = (batch["input_ids"], batch["labels"])

Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met Accelerator

accelerator = \
    Accelerator(gradient_accumulation_steps=2)

for index, batch in enumerate(dataloader):

        inputs, targets = (batch["input_ids"],
                           batch["labels"])
        outputs = model(inputs, 
                        labels=targets)
        loss = outputs.loss





Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met Accelerator

accelerator = \
    Accelerator(gradient_accumulation_steps=2)

for index, batch in enumerate(dataloader):
    with accelerator.accumulate(model):
        inputs, targets = (batch["input_ids"],
                           batch["labels"])
        outputs = model(inputs, 
                        labels=targets)
        loss = outputs.loss




Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met Accelerator

accelerator = \
    Accelerator(gradient_accumulation_steps=2)

for index, batch in enumerate(dataloader):
    with accelerator.accumulate(model):
        inputs, targets = (batch["input_ids"],
                           batch["labels"])
        outputs = model(inputs, 
                        labels=targets)
        loss = outputs.loss
        accelerator.backward(loss)



Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met Accelerator

accelerator = \
    Accelerator(gradient_accumulation_steps=2)

for index, batch in enumerate(dataloader):
    with accelerator.accumulate(model):
        inputs, targets = (batch["input_ids"],
                           batch["labels"])
        outputs = model(inputs, 
                        labels=targets)
        loss = outputs.loss
        accelerator.backward(loss)



Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met Accelerator

accelerator = \
    Accelerator(gradient_accumulation_steps=2)

for index, batch in enumerate(dataloader):
    with accelerator.accumulate(model):
        inputs, targets = (batch["input_ids"],
                           batch["labels"])
        outputs = model(inputs, 
                        labels=targets)
        loss = outputs.loss
        accelerator.backward(loss)
        optimizer.step()
        lr_scheduler.step()
        optimizer.zero_grad()

Diagram: gradiëntaccumulatie als som van gradiënten uit meerdere batches.

Efficiënt AI-modellen trainen met PyTorch

Van Accelerator naar Trainer

Grafiek: gebruiksgemak vs. maatwerk voor PyTorch, Accelerator en Trainer.

Efficiënt AI-modellen trainen met PyTorch

Van Accelerator naar Trainer

Grafiek: gebruiksgemak vs. maatwerk voor PyTorch, Accelerator en Trainer.

Efficiënt AI-modellen trainen met PyTorch

Gradiëntaccumulatie met Trainer

training_args = TrainingArguments(output_dir="./results",
                                  evaluation_strategy="epoch",
                                  gradient_accumulation_steps=2)

trainer = Trainer(model=model, args=training_args, train_dataset=dataset["train"], eval_dataset=dataset["validation"], compute_metrics=compute_metrics)
trainer.train()
{'epoch': 1.0, 'eval_loss': 0.73, 'eval_accuracy': 0.03, 'eval_f1': 0.05}
{'epoch': 2.0, 'eval_loss': 0.68, 'eval_accuracy': 0.19, 'eval_f1': 0.25}
Efficiënt AI-modellen trainen met PyTorch

Laten we oefenen!

Efficiënt AI-modellen trainen met PyTorch

Preparing Video For Download...