高度な ファインチューニング

大規模言語モデル(LLM)の基本

Vidhi Chugh

AI strategist and ethicist

このステップの位置

プロセス中の高度なファインチューニングの段階にあることを示す図

大規模言語モデル(LLM)の基本

人間のフィードバックによる強化学習

  • 事前学習
  • ファインチューニング
  • 人間のフィードバックによる強化学習(RLHF)

絵文字と星を使って前向きなフィードバックをする4人のイラスト。

大規模言語モデル(LLM)の基本

事前学習

  • 大量のテキストデータ:
    • ウェブサイト、書籍、記事
    • Transformerアーキテクチャ
    • 言語の一般的なパターンや文法、知識を習得
  • 次の単語予測
  • マスク言語モデリング

LLMを構築するための事前学習プロセス

1 Freepik
大規模言語モデル(LLM)の基本

ファインチューニング

  • Nショット学習
  • 関連タスク用のラベル付きデータセット

ファインチューニングのプロセス

大規模言語モデル(LLM)の基本

なぜRLHFが必要なのか

  • 汎用トレーニングデータでは質が不十分
    • ノイズ
    • エラー
    • 一貫性がない
    • 精度低下

精度を低下させる例:

  • オンライン掲示板のデータを学習する
  • 裏付けのない個人の意見や事実
  • 専門知識を持つ人間によるデータの検証が必要

的を外した矢が散在しているアーチェリーの的

大規模言語モデル(LLM)の基本

ファインチューニングの必要性

  • 事前学習
    • 言語の基本的なパターンを習得
    • 特定の文脈における言語の複雑さを捉えない
  • ファインチューニング
    • 高品質なラベル付きデータセットで性能を上げる
  • ここにRLHF!
    • 人間のフィードバック
大規模言語モデル(LLM)の基本

RLHFの簡単なステップ

  • モデルの回答を人間がレビューする
  • 人間のフィードバックに基づきモデルを更新
  • ステップ 1:
    • プロンプトを受け取る
    • 複数の応答を生成

入力プロンプトを取り込み、応答を生成するLLM

大規模言語モデル(LLM)の基本

人間による検証

  • ステップ 2:
    • 人間がこれらの回答を確認
    • クオリティに基づいて応答をランク付け
      • 正確性
      • 関連性
      • 一貫性

LLMの応答に人間によるレビューを追加する

大規模言語モデル(LLM)の基本

フィードバックを学習

  • ステップ 3:
    • 人間が付けたランキングを学習させる
    • 今後の回答をその評価に沿って生成する
  • これを繰り返す!
    • 応答の生成し続ける
    • 人間からの評価を受け取る
    • 学習を調整していく

人間の評価がLLMに反映される

大規模言語モデル(LLM)の基本

まとめ

  • 事前学習で汎用的な言語知識を学習
  • 特定タスク向けのファインチューニング
  • RLHF手法による人間のフィードバックを通じたファインチューニングの強化
  • この組み合わせは非常に効果的
大規模言語モデル(LLM)の基本

LLMの完成

LLMの学習プロセス全体

大規模言語モデル(LLM)の基本

練習しましょう!

大規模言語モデル(LLM)の基本

Preparing Video For Download...