潜在ディリクレ配分法(LDA)
Rで始めるテキスト分析
Maham Faisal Khan
Senior Data Science Content Developer
教師なし学習
自然言語処理(NLP)の用語:
潜在ディリクレ配分法(LDA)は代表的なトピックモデルです
文書の集合はコーパスと呼びます
Bag-of-wordsは文書内の各語を独立に扱います
トピックモデルは共起する語のパターンを見つけます
予測ではなくパターン探索を行う手法は教師なし学習と呼びます
語の確率
クラスタリング vs. トピックモデル
クラスタリング
距離(連続量)に基づきクラスタを抽出します。
各オブジェクトは1つのクラスタに属します。
トピックモデル
語の頻度(離散量)に基づきトピックを抽出します。
各文書はすべてのトピックの混合(部分的所属)です。
演習に進みましょう
Rで始めるテキスト分析
Preparing Video For Download...