使用 R 的 Bag-of-Words 进行文本挖掘
Ted Kwartler
Instructor
# 将 TDM 转为矩阵 chardonnay_tdm <- TermDocumentMatrix(clean_chardonnay) chardonnay_m <- as.matrix(chardonnay_tdm)# 按词频汇总并排序 term_frequency <- rowSums(chardonnay_m) word_freqs <- data.frame(term = names(term_frequency), num = term_frequency)# 生成词云 wordcloud(word_freqs$term, word_freqs$num, max.words = 100, colors = "red")

clean_corpus <- function(corpus){
corpus <- tm_map(corpus, removePunctuation)
corpus <- tm_map(corpus, stripWhitespace)
corpus <- tm_map(corpus, removeNumbers)
corpus <- tm_map(corpus,
content_transformer(tolower))
corpus <- tm_map(corpus, removeWords,
c(stopwords("en"), "amp"))
return(corpus)
}

clean_corpus <- function(corpus){ corpus <- tm_map(corpus, removePunctuation) corpus <- tm_map(corpus, stripWhitespace) corpus <- tm_map(corpus, removeNumbers) corpus <- tm_map(corpus, content_transformer(tolower))corpus <- tm_map(corpus, removeWords, c(stopwords("en"), "amp", "chardonnay", "wine", "glass"))return(corpus) }

使用 R 的 Bag-of-Words 进行文本挖掘