토픽 모델 실행

R로 시작하는 텍스트 분석

Maham Faisal Khan

Senior Data Science Content Developer

LDA() 사용

library(topicmodels)

lda_out <- LDA( dtm_review, k = 2, method = "Gibbs", control = list(seed = 42) )
R로 시작하는 텍스트 분석

LDA() 출력

lda_out
2개의 토픽을 가진 LDA_Gibbs 토픽 모델입니다.
R로 시작하는 텍스트 분석

glimpse() 사용

glimpse(lda_out)
Formal class 'LDA_Gibbs' [package "topicmodels"] with 16 slots
  ..@ seedwords      : NULL
  ..@ z              : int [1:75670] 1 2 2 1 1 2 1 1 2 2 ...
  ..@ alpha          : num 25
  ..@ call           : language LDA(x = dtm_review, k = 2, method = "Gibbs", ...
  ..@ Dim            : int [1:2] 1791 9668
  ..@ control        :Formal class 'LDA_Gibbscontrol' [package "topicmodels"] ...
  ..@ beta           : num [1:2, 1:17964] -8.81 -10.14 -9.09 -8.43 -12.53 ...
  ...
R로 시작하는 텍스트 분석

tidy() 사용

lda_topics <- lda_out %>% 
  tidy(matrix = "beta")

lda_topics %>% arrange(desc(beta))
# A tibble: 19,336 x 3
   topic term       beta
   <int> <chr>     <dbl>
 1     1 hair     0.0241
 2     2 clean    0.0231
 3     2 cleaning 0.0201
# … with 19,333 more rows
R로 시작하는 텍스트 분석

연습해 봅시다!

R로 시작하는 텍스트 분석

Preparing Video For Download...