潜在ディリクレ配分法(LDA)

Rで始めるテキスト分析

Maham Faisal Khan

Senior Data Science Content Developer

教師なし学習

自然言語処理(NLP)の用語:

  • 潜在ディリクレ配分法(LDA)は代表的なトピックモデルです
  • 文書の集合はコーパスと呼びます
  • Bag-of-wordsは文書内の各語を独立に扱います
  • トピックモデルは共起する語のパターンを見つけます
  • 予測ではなくパターン探索を行う手法は教師なし学習と呼びます
Rで始めるテキスト分析

語の確率

Rで始めるテキスト分析

クラスタリング vs. トピックモデル

クラスタリング

  • 距離(連続量)に基づきクラスタを抽出します。
  • 各オブジェクトは1つのクラスタに属します。

トピックモデル

  • 語の頻度(離散量)に基づきトピックを抽出します。
  • 各文書はすべてのトピックの混合(部分的所属)です。
Rで始めるテキスト分析

演習に進みましょう

Rで始めるテキスト分析

Preparing Video For Download...