テキストのクリーニングと前処理

Rで学ぶBag-of-Wordsによるテキストマイニング

Ted Kwartler

Instructor

一般的な前処理関数

前処理関数の例

Rで学ぶBag-of-Wordsによるテキストマイニング

前処理の実例

前処理

# ベクターソースを作成: coffee_source
coffee_source <- VectorSource(coffee_tweets)

# 揮発性コーパスを作成: coffee_corpus coffee_corpus <- VCorpus(coffee_source)
# 各種前処理関数を適用 tm_map(coffee_corpus, removeNumbers) tm_map(coffee_corpus, removePunctuation)
tm_map(coffee_corpus, content_transformer(replace_abbreviation))
Rで学ぶBag-of-Wordsによるテキストマイニング

別の前処理: ステミング

# 語幹化
stem_words <- stemDocument(c("complicatedly", "complicated","complication"))
stem_words
"complic" "complic" "complic"
# 単語辞書で補完
stemCompletion(stem_words, c("complicate"))
     complic      complic      complic 
"complicate" "complicate" "complicate"
# コーパス全体で補完
stemCompletion(stem_words, my_corpus)
Rで学ぶBag-of-Wordsによるテキストマイニング

演習に進みましょう!

Rで学ぶBag-of-Wordsによるテキストマイニング

Preparing Video For Download...