텍스트 정리와 전처리

R로 배우는 Bag-of-Words 텍스트 마이닝

Ted Kwartler

Instructor

자주 쓰는 전처리 함수

전처리 함수

R로 배우는 Bag-of-Words 텍스트 마이닝

전처리 실습

전처리

# 벡터 소스 생성: coffee_source
coffee_source <- VectorSource(coffee_tweets)

# 휘발성 코퍼스 생성: coffee_corpus coffee_corpus <- VCorpus(coffee_source)
# 전처리 함수 적용 tm_map(coffee_corpus, removeNumbers) tm_map(coffee_corpus, removePunctuation)
tm_map(coffee_corpus, content_transformer(replace_abbreviation))
R로 배우는 Bag-of-Words 텍스트 마이닝

또 다른 전처리: 어간 추출

# 어간 추출
stem_words <- stemDocument(c("complicatedly", "complicated","complication"))
stem_words
"complic" "complic" "complic"
# 단일 단어 사전으로 원형 복원
stemCompletion(stem_words, c("complicate"))
     complic      complic      complic 
"complicate" "complicate" "complicate"
# 전체 코퍼스로 원형 복원
stemCompletion(stem_words, my_corpus)
R로 배우는 Bag-of-Words 텍스트 마이닝

연습해 봅시다!

R로 배우는 Bag-of-Words 텍스트 마이닝

Preparing Video For Download...