NLPの概要

大規模言語モデル(LLM)の基本

Vidhi Chugh

AI strategist and ethicist

このステップの位置

プロセスの最初のステップ、テキスト前処理を示している

大規模言語モデル(LLM)の基本

テキストの前処理

  • 独立したステップで、順序を変えることも可能

テキスト前処理の3つの最も一般的なステップ

大規模言語モデル(LLM)の基本

トークン化

  • テキストを個々の単語(トークン)に分割
  • テキスト:
    • 「自然言語処理の技術を取り扱うのは難しい。」
  • トークン化:
    • ["自然”, ”言語", "処理", "の", "技術", "を", "取り扱う", "のは", "難しい", "。"]
    • リストに変換する
大規模言語モデル(LLM)の基本

ストップワードの除去

  • ストップワード:それ自体に意味を持たない言葉
  • ストップワード除去ステップで削除
  • ストップワード除去
    • ["自然言語処理", "の", "技術", "を", "取り扱う", "のは", "難しい", "。"]
  • ストップワード除去
    • ["自然言語処理", "技術", "取り扱う", "難しい", "。"]
大規模言語モデル(LLM)の基本

見出し語化

  • 似た意味を持つ違う形の単語をグループ化する
  • 単語を原型に戻す
  • 語根に対応付ける
  • 話している -> 話す

  • 話した -> 話す

  • 話す -> 話す

大規模言語モデル(LLM)の基本

テキスト表現

プロセス中のテキスト表現段階を示しています

大規模言語モデル(LLM)の基本

テキスト表現

  • テキストデータを数値形式に変換
  • Bag of Words
  • 単語埋め込み

数値としての音声を示す画像

大規模言語モデル(LLM)の基本

Bag of Words

  • テキストを単語の出現数の行列に変換

Bag of Wordsを表現するための表

  • 0はその単語が存在しないことを示す
大規模言語モデル(LLM)の基本

Bag of Wordsの限界

  • 語順や文脈を捉えられない

    • テキストの解釈を誤る可能性
    • 似た文でも、意味が逆転する
      • 「猫は素早くネズミを追いかけた。」
      • 「ネズミが猫を追いかけた。」
  • 単語間の関係性を捉えていない

    • 関連する語を独立したものとして扱う
    • 例:「猫」と「ネズミ」
大規模言語モデル(LLM)の基本

単語埋め込み

  • 単語の意味を数値で捉える
ネズミ
植物 -0.9 -0.8
毛皮がある 0.9 0.7
肉食 0.9 -0.8
  • 猫 [-0.9, 0.9, 0.9]
  • 捕食者と獲物関係:

捕食者-獲物の単語埋め込み

大規模言語モデル(LLM)の基本

機械が読める形式に

  • まずテキストの前処理から始める

データ前処理ワークフロー

大規模言語モデル(LLM)の基本

機械が読める形式に

  • 前処理済みテキストを数値形式に変換する

データ準備ワークフローとテキスト表現の手順

大規模言語モデル(LLM)の基本

練習しましょう!

大規模言語モデル(LLM)の基本

Preparing Video For Download...