잠재 디리클레 할당

R로 시작하는 텍스트 분석

Maham Faisal Khan

Senior Data Science Content Developer

비지도 학습

자연어 처리(NLP) 용어 더 알아보기:

  • Latent Dirichlet allocation(LDA)는 표준 토픽 모델입니다
  • 문서 모음은 코퍼스라고 합니다
  • Bag-of-words는 문서의 각 단어를 개별로 취급합니다
  • 토픽 모델은 함께 나타나는 단어 패턴을 찾습니다
  • 예측이 아닌 패턴을 찾는 것은 비지도 학습이라고 합니다
R로 시작하는 텍스트 분석

단어 확률

R로 시작하는 텍스트 분석

클러스터링 vs. 토픽 모델링

클러스터링

  • 클러스터는 연속적인 거리 기반으로 찾습니다.
  • 각 객체는 하나의 클러스터에만 배정됩니다.

토픽 모델링

  • 토픽은 이산적인 단어 빈도 기반으로 찾습니다.
  • 각 문서는 모든 토픽의 혼합(부분적 소속)입니다.
R로 시작하는 텍스트 분석

연습해 봅시다!

R로 시작하는 텍스트 분석

Preparing Video For Download...