Làm sạch và tiền xử lý văn bản

Khai phá văn bản với Bag-of-Words trong R

Ted Kwartler

Instructor

Các hàm tiền xử lý phổ biến

các hàm tiền xử lý copy.png

Khai phá văn bản với Bag-of-Words trong R

Tiền xử lý trong thực tiễn

tiền xử lý.png

# Tạo nguồn vector: coffee_source
coffee_source <- VectorSource(coffee_tweets)

# Tạo corpus volatile: coffee_corpus coffee_corpus <- VCorpus(coffee_source)
# Áp dụng các hàm tiền xử lý tm_map(coffee_corpus, removeNumbers) tm_map(coffee_corpus, removePunctuation)
tm_map(coffee_corpus, content_transformer(replace_abbreviation))
Khai phá văn bản với Bag-of-Words trong R

Bước tiền xử lý khác: rút gốc từ

# Rút gốc từ (stemming)
stem_words <- stemDocument(c("complicatedly", "complicated","complication"))
stem_words
"complic" "complic" "complic"
# Hoàn chỉnh từ bằng từ điển một từ
stemCompletion(stem_words, c("complicate"))
     complic      complic      complic 
"complicate" "complicate" "complicate"
# Hoàn chỉnh từ bằng toàn bộ corpus
stemCompletion(stem_words, my_corpus)
Khai phá văn bản với Bag-of-Words trong R

Hãy luyện tập!

Khai phá văn bản với Bag-of-Words trong R

Preparing Video For Download...