Wprowadzenie do chmur słów

Eksploracja tekstu metodą Bag-of-Words w R

Ted Kwartler

Instructor

Prosta chmura słów

# Convert TDM to matrix
chardonnay_tdm <- TermDocumentMatrix(clean_chardonnay)
chardonnay_m <- as.matrix(chardonnay_tdm)

# Sum rows and sort by frequency term_frequency <- rowSums(chardonnay_m) word_freqs <- data.frame(term = names(term_frequency), num = term_frequency)
# Make word cloud wordcloud(word_freqs$term, word_freqs$num, max.words = 100, colors = "red")

wordcloud.png

Eksploracja tekstu metodą Bag-of-Words w R

Wpływ stop słów

clean_corpus <- function(corpus){
  corpus <- tm_map(corpus, removePunctuation)
  corpus <- tm_map(corpus, stripWhitespace)
  corpus <- tm_map(corpus, removeNumbers)
  corpus <- tm_map(corpus, 
                   content_transformer(tolower))
  corpus <- tm_map(corpus, removeWords, 
                   c(stopwords("en"), "amp"))
  return(corpus)
}

wordcloud2.png

Eksploracja tekstu metodą Bag-of-Words w R

Usuwanie mało informatywnych słów

clean_corpus <- function(corpus){
  corpus <- tm_map(corpus, removePunctuation)
  corpus <- tm_map(corpus, stripWhitespace)
  corpus <- tm_map(corpus, removeNumbers)
  corpus <- tm_map(corpus, 
                   content_transformer(tolower))

corpus <- tm_map(corpus, removeWords, c(stopwords("en"), "amp", "chardonnay", "wine", "glass"))
return(corpus) }

wordcloud3.png

Eksploracja tekstu metodą Bag-of-Words w R

Czas na ćwiczenia!

Eksploracja tekstu metodą Bag-of-Words w R

Preparing Video For Download...