PyTorch ile Verimli AI Model Eğitimi
Dennis Lee
Data Engineer, Amazon

from datasets import load_dataset
dataset = load_dataset("glue", "mrpc")
print(dataset)
DatasetDict({
train: Dataset({
features: ['sentence1', 'sentence2', 'label', 'idx'],
})
validation: Dataset({
features: ['sentence1', 'sentence2', 'label', 'idx'],
})
test: Dataset({
features: ['sentence1', 'sentence2', 'label', 'idx'],
})
})
dataset["train"]
sentence1, sentence2, labeldataset["train"]["sentence1"]
tokenizer = AutoTokenizer.from_pretrained("distilbert-base-cased")
sentence1 ve sentence2 alıntruncation: Girdi azami uzunluğu (512 token) aşarsa keserpadding: Tüm girdiler aynı uzunlukta olsun diye kısa dizileri sıfırlarla doldururdef encode(example):return tokenizer( example["sentence1"], example["sentence2"],truncation=True,padding="max_length", )
map ile train bölümündeki her örneğe encode uygulayıntrain_dataset = dataset["train"].map(encode, batched=True)
label alanını labels olarak yeniden adlandırıntrain_dataset = train_dataset.map(
lambda examples: {"labels": examples["label"]}, batched=True
)
dataloader = DataLoader(train_dataset, batch_size=32, shuffle=True)
dataloader = accelerator.prepare(dataloader)
DataLoader içindeki herhangi bir PyTorch veri kümesi (torch.utils.data.Dataset) ile çalışırcheckpoint_dir = Path("preprocess_checkpoint")
accelerator.save_state(checkpoint_dir)
accelerator.load_state(checkpoint_dir)
PyTorch ile Verimli AI Model Eğitimi