LLMを訓練する基本要素

大規模言語モデル(LLM)の基本

Vidhi Chugh

AI strategist and ethicist

このステップの位置

学習の進捗を事前学習として示す画像

大規模言語モデル(LLM)の基本

生成的事前学習

  • 生成的事前学習を使って訓練する

    • テキストトークンのデータセット
    • データセット内のトークンを予測させる学習
  • 生成的事前学習の種類:
    • 次の単語予測
    • マスク言語モデリング
大規模言語モデル(LLM)の基本

次の単語予測

  • 教師あり学習手法
    • 入出力ペアで学習されたモデル
  • 次の単語を予測し、一貫した文を生成
  • 単語間の関係を捉える
  • 学習データ内容
    • 入力と出力のペア

検索エンジンによる自動候補表示

大規模言語モデル(LLM)の基本

次の単語予測のための学習データ

入力

素早い茶色い

素早い茶色いキツネ

素早い茶色いキツネが

素早い茶色いキツネが怠惰な

素早い茶色いキツネが怠惰な犬

素早い茶色いキツネが怠惰な犬を

素早い茶色いキツネが怠惰な犬を飛び越える。

出力

キツネ

怠惰な

飛び越える。

大規模言語モデル(LLM)の基本

ピザに関連する単語

  • 例が多いほど予測精度が上がる
    • 〇〇が乗ったピザを食べるのが好き
  • ピザにはチーズが最も関連する

ピザという単語と異なる単語の関連確率

大規模言語モデル(LLM)の基本

マスク言語モデリング

  • 特定の単語を隠す

  • 学習済みモデルが隠された(マスクされた)単語を予測

  • 元のテキスト: 素早い茶色いキツネが、怠惰な犬を飛び越える

  • マスクされたテキスト: 素早い[マスク]キツネが、怠惰な犬を飛び越える

  • 目的:マスクされた単語を予測する

  • これまでの訓練データをもとに予測する

大規模言語モデル(LLM)の基本

練習しましょう!

大規模言語モデル(LLM)の基本

Preparing Video For Download...