使用 R 的 Bag-of-Words 进行文本挖掘
Ted Kwartler
Instructor


# 创建向量源:coffee_source coffee_source <- VectorSource(coffee_tweets)# 创建临时语料库:coffee_corpus coffee_corpus <- VCorpus(coffee_source)# 应用多种预处理函数 tm_map(coffee_corpus, removeNumbers) tm_map(coffee_corpus, removePunctuation)tm_map(coffee_corpus, content_transformer(replace_abbreviation))
# 词干提取
stem_words <- stemDocument(c("complicatedly", "complicated","complication"))
stem_words
"complic" "complic" "complic"
# 使用单词词典还原词干
stemCompletion(stem_words, c("complicate"))
complic complic complic
"complicate" "complicate" "complicate"
# 使用整个语料库还原词干
stemCompletion(stem_words, my_corpus)
使用 R 的 Bag-of-Words 进行文本挖掘