データに関する懸念と考慮事項

大規模言語モデル(LLM)の基本

Vidhi Chugh

AI strategist and ethicist

データに関する留意点

データに関する考慮事項

  • データ量と計算資源
  • データ品質
  • ラベリング
  • バイアス
  • プライバシー
大規模言語モデル(LLM)の基本

データ量と計算資源

  • LLMには膨大なデータが必要
    • 子どもが言葉を覚えることに類似
    • 570GB、約130万冊の本に相当

子どもが話すことを学んでいるイラスト

1 Freepik
大規模言語モデル(LLM)の基本

データ量と計算資源

  • LLMには膨大なデータが必要
    • 子どもが言葉を覚えることに類似
    • 570GB、約130万冊の本に相当
  • 大規模な計算資源、エネルギー消費
  • 数百万ドル相当のコスト

大きなサーバーに接続されたコンピューターで作業する男性

大規模言語モデル(LLM)の基本

データ品質

  • 高品質なデータを使うことは非常に重要
  • 正確なデータ = モデル学習精度UP = 回答の質UP = 信頼性UP
  • 子どもの言語学習
    • 間違いの多いデータで学習→質の低い回答

誤りや文法の悪いデータでLLMを学習させると低品質な出力になる

大規模言語モデル(LLM)の基本

ラベル付きデータ

  • 正しいラベル付け:正確な学習、パターンを普遍化、精度の高い回答に

  • 手間のかかる作業:各ニュース記事に正しいラベルを付ける

コンピューターでデータにラベル付けするチーム

  • ラベルの付け間違いはモデルのパフォーマンスに影響
  • 誤りに対処:特定 -> 分析 -> 改善を繰り返す
大規模言語モデル(LLM)の基本

データのバイアス(偏り)

  • 社会的な固定概念の影響を受けている
  • 学習データの多様性が不足している
  • 差別的で公平性に欠ける回答
  • バイアスのかかったデータを特定して対処する
    • データの不均衡を減らす
    • 多様性を高める
    • バイアス軽減の手法:より多様な例を取り入れる

データバイアス

  • 例:

    • 「看護師は…と言った」→「彼女」または「彼女の」
大規模言語モデル(LLM)の基本

データプライバシー

  • 個人情報保護やプライバシーへの法令準拠
  • プライバシーは非常に重要な問題
    • 許可なくモデルを学習させるのはプライバシー侵害の恐れ
    • 法律違反、罰金、評判のリスク
  • 機密情報や個人が特定可能な情報
  • 許可を取得すること

データプライバシー

大規模言語モデル(LLM)の基本

練習しましょう!

大規模言語モデル(LLM)の基本

Preparing Video For Download...