Transformerについて

大規模言語モデル(LLM)の基本

Vidhi Chugh

AI strategist and ethicist

このステップの位置

Transformer学習のプロセス

大規模言語モデル(LLM)の基本

Transformerとは

  • 「Attention Is All You Need」
    • 言語モデリングを革新
  • Transformerアーキテクチャ
    • 単語間の関係を捉える
    • 構成要素: テキストの前処理、位置エンコーディング、エンコーダー、デコーダー

「Attention Is All You Need」の論文の抜粋

1 arXiv: Attention Is All You Need
大規模言語モデル(LLM)の基本

Transformerの内部

  • 入力: ニューヨークに住むジェーンは、ソフトウェア

Transformer内部の構成要素とデータのフロー

  • 出力:エンジニアで、新しいレストランを開拓するのが好き
大規模言語モデル(LLM)の基本

Transformerはオーケストラのようなものです

オーケストラの画像

大規模言語モデル(LLM)の基本

テキストの前処理と表現

  • テキスト前処理:トークン化、ストップワード除去、見出し語化
  • テキスト表現:単語埋め込み

Transformerの最初の構成要素がハイライトされた図と注釈

大規模言語モデル(LLM)の基本

位置エンコーディング

  • 各単語の位置情報
  • 離れた単語同士を理解する

Transformerの2番目の構成要素がハイライトされた図と音楽のイラスト]

大規模言語モデル(LLM)の基本

エンコーダー

  • アテンション機構:特定の単語とその関係性に焦点を当てる
  • ニューラルネットワーク:入力データの特徴を段階的に処理

Transformerの流れにおけるエンコーダー

大規模言語モデル(LLM)の基本

デコーダー

  • アテンション機構とニューラルネットワークを含む
  • 最終的な出力を生成

Transformerのデコーダー要素

大規模言語モデル(LLM)の基本

Transformerと長距離依存関係

  • 初期の課題:長距離依存性
  • アテンション:テキストのさまざまな箇所に柔軟に注目する
  • : 「ニューヨークに住むジェーンは、ソフトウェアエンジニアで、新しいレストランを開拓するのが好き」

  • ”ジェーン” --- "新しいレストランを開拓するのが好き"

大規模言語モデル(LLM)の基本

複数のパートを同時処理

  • 従来の言語モデルの制限
    • 1語ずつ順次に処理
  • Transformer
    • 複数のパートを同時に処理
    • 処理がより高速に
    • "猫がマットに座った"
    • 「猫」「が」「マット」「に」「座った」を同時に処理
大規模言語モデル(LLM)の基本

練習しましょう!

大規模言語モデル(LLM)の基本

Preparing Video For Download...