Інтерпретація тем

Вступ до аналізу тексту в R

Maham Faisal Khan

Senior Data Science Content Developer

Дві теми

lda_topics <- LDA(
  dtm_review,
  k = 2,
  method = "Gibbs",
  control = list(seed = 42)
) %>% 
  tidy(matrix = "beta")

word_probs <- lda_topics %>% group_by(topic) %>% slice_max(beta, n = 15) %>% ungroup() %>% mutate(term2 = fct_reorder(term, beta))
Вступ до аналізу тексту в R

Дві теми

ggplot(
  word_probs, 
  aes(
    term2, 
    beta, 
    fill = as.factor(topic)
  )
) +
  geom_col(show.legend = FALSE) +
  facet_wrap(~ topic, scales = "free") +
  coord_flip()

Вступ до аналізу тексту в R

Три теми

lda_topics2 <- LDA(
  dtm_review,
  k = 3,
  method = "Gibbs",
  control = list(seed = 42)
) %>% 
  tidy(matrix = "beta")

word_probs2 <- lda_topics2 %>% group_by(topic) %>% slice_max(beta, n = 15) %>% ungroup() %>% mutate(term2 = fct_reorder(term, beta))
Вступ до аналізу тексту в R

Три теми

ggplot(
  word_probs2, 
  aes(
    term2, 
    beta, 
    fill = as.factor(topic)
  )
) +
  geom_col(show.legend = FALSE) +
  facet_wrap(~ topic, scales = "free") +
  coord_flip()

Вступ до аналізу тексту в R

Чотири теми

Вступ до аналізу тексту в R

Мистецтво вибору моделі

  • Добре додавати нові, відмінні теми
  • Якщо теми починають повторюватися — це забагато
  • Називайте теми за поєднанням слів із високою ймовірністю
Вступ до аналізу тексту в R

Давайте потренуємось!

Вступ до аналізу тексту в R

Preparing Video For Download...