Hugging Face でのモデルのファインチューニング

Llama 3 のファインチューニング

Francesca Donadoni

Curriculum Manager, DataCamp

ファインチューニングに必要なものは?

  1. 言語モデル+トークナイザー(TinyLLama-v0 などの LLama 系)
  2. 学習データセット(Bitext カスタマーサポート データセット
  3. 学習用引数
  4. ファインチューニング(TRLSFTTrainer
  5. 評価用ベンチマークまたはデータセット

学習ループ。学習は引数・データ・モデルを入力に取り、ファインチューニング済みモデルを出力します。評価はファインチューニング済みモデルと評価用データセットで行います。

Llama 3 のファインチューニング

Auto クラスでモデルとトークナイザーを読み込む方法

model_name="Maykeye/TinyLLama-v0"

model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)

tokenizer.pad_token = tokenizer.eos_token
1 https://huggingface.co/docs/transformers/main/en/model_doc/auto
Llama 3 のファインチューニング

TrainingArguments で学習パラメータを定義する

training_arguments = TrainingArguments(

per_device_train_batch_size=1,
learning_rate=2e-3,
max_grad_norm=0.3,
max_steps=200,
... gradient_accumulation_steps=2, save_steps=10,
)
1 https://huggingface.co/docs/transformers/v4.40.1/en/main_classes/trainer#transformers.TrainingArguments
Llama 3 のファインチューニング

SFTTrainer による学習設定方法

trainer = SFTTrainer(

model=model, tokenizer=tokenizer,
train_dataset=dataset, dataset_text_field='conversation',
max_seq_length=250,
args=training_arguments
)
Llama 3 のファインチューニング

SFTTrainer の結果の読み取り方

trainer.train()
TrainOutput(global_step=200, training_loss=1.9401231002807617,
            metrics={'train_runtime': 142.5501, 
                     'train_samples_per_second': 2.806,
                     'train_steps_per_second': 1.403, 
                     'total_flos': 1461265827840.0, 
                     'train_loss': 1.9401231002807617, 
                     'epoch': 2.0})
Llama 3 のファインチューニング

ROUGE-1 を用いた学習済みモデルの評価方法

  • ROUGE-1: 参照文と生成文の単語の重なり率
import evaluate

rouge = evaluate.load('rouge')
predictions = ["hello there", "general kenobi"] references = ["hello there", "master yoda"]
results = rouge.compute(predictions=predictions, references=references) print(results)
{'rouge1': 0.5, 'rouge2': 0.5, 'rougeL': 0.5, 'rougeLsum': 0.5}
1 https://huggingface.co/spaces/evaluate-metric/rouge
Llama 3 のファインチューニング

ROUGE-1 スコアの使い方

  1. evaluation_dataset の評価用データを使う
def generate_predictions_and_reference(dataset):
    predictions = []
    references = []
    for row in dataset:
        inputs = tokenizer.encode(row["instruction"], return_tensors="pt")

outputs = model.generate(inputs)
decoded_outputs = tokenizer.decode(outputs[0, inputs.shape[1]:], skip_special_tokens = True)
references += [row["response"]] predictions += [decoded_outputs] return references, predictions
Llama 3 のファインチューニング

評価セットで ROUGE-1 を実行する方法

references, predictions = generate_predictions_and_reference(evaluation_dataset)
rouge = evaluate.load('rouge')
results = rouge.compute(predictions=predictions, references=references)
print(results)
Llama 3 のファインチューニング

ファインチューニング有無の比較

ファインチューニング済み

{'rouge1': 0.22425812699023645,
 'rouge2': 0.039502543246449,
 'rougeL': 0.1501513006868983,
 'rougeLsum': 0.18685597710721613}

ファインチューニングなし

{'rouge1': 0.1310928764315105,
 'rouge2': 0.04581654122835097,
 'rougeL': 0.08415351421221628,
 'rougeLsum': 0.1224749866097021}
Llama 3 のファインチューニング

練習しましょう!

Llama 3 のファインチューニング

Preparing Video For Download...