清洗与预处理文本

使用 R 的 Bag-of-Words 进行文本挖掘

Ted Kwartler

Instructor

常见预处理函数

常见预处理函数 copy.png

使用 R 的 Bag-of-Words 进行文本挖掘

预处理示例

预处理.png

# 创建向量源:coffee_source
coffee_source <- VectorSource(coffee_tweets)

# 创建临时语料库:coffee_corpus coffee_corpus <- VCorpus(coffee_source)
# 应用多种预处理函数 tm_map(coffee_corpus, removeNumbers) tm_map(coffee_corpus, removePunctuation)
tm_map(coffee_corpus, content_transformer(replace_abbreviation))
使用 R 的 Bag-of-Words 进行文本挖掘

另一预处理步骤:词干提取

# 词干提取
stem_words <- stemDocument(c("complicatedly", "complicated","complication"))
stem_words
"complic" "complic" "complic"
# 使用单词词典还原词干
stemCompletion(stem_words, c("complicate"))
     complic      complic      complic 
"complicate" "complicate" "complicate"
# 使用整个语料库还原词干
stemCompletion(stem_words, my_corpus)
使用 R 的 Bag-of-Words 进行文本挖掘

让我们来练习!

使用 R 的 Bag-of-Words 进行文本挖掘

Preparing Video For Download...