高度な ファインチューニング
大規模言語モデル(LLM)の基本
Vidhi Chugh
AI strategist and ethicist
このステップの位置
人間のフィードバックによる強化学習
事前学習
ファインチューニング
人間のフィードバックによる強化学習(RLHF)
事前学習
大量のテキストデータ:
ウェブサイト、書籍、記事
Transformerアーキテクチャ
言語の一般的なパターンや文法、知識を習得
次の単語予測
マスク言語モデリング
1
Freepik
ファインチューニング
Nショット学習
関連タスク用のラベル付きデータセット
なぜRLHFが必要なのか
汎用トレーニングデータでは質が不十分
ノイズ
エラー
一貫性がない
精度低下
精度を低下させる例:
オンライン掲示板のデータを学習する
裏付けのない個人の意見や事実
専門知識を持つ人間によるデータの検証が必要
ファインチューニングの必要性
事前学習
言語の基本的なパターンを習得
特定の文脈における言語の複雑さを捉えない
ファインチューニング
高品質なラベル付きデータセットで性能を上げる
ここにRLHF!
人間のフィードバック
RLHFの簡単なステップ
モデルの回答を人間がレビューする
人間のフィードバックに基づきモデルを更新
ステップ 1:
プロンプトを受け取る
複数の応答を生成
人間による検証
ステップ 2:
人間がこれらの回答を確認
クオリティに基づいて応答をランク付け
正確性
関連性
一貫性
フィードバックを学習
ステップ 3:
人間が付けたランキングを学習させる
今後の回答をその評価に沿って生成する
これを繰り返す!
応答の生成し続ける
人間からの評価を受け取る
学習を調整していく
まとめ
事前学習
で汎用的な言語知識を学習
特定タスク向けの
ファインチューニング
RLHF
手法による人間のフィードバックを通じたファインチューニングの強化
この組み合わせは非常に効果的
LLMの完成
練習しましょう!
大規模言語モデル(LLM)の基本
Preparing Video For Download...