Tvorba nových příznaků z textu

Sentiment Analysis v Pythonu

Violeta Misheva

Data Scientist

Cíl videa

 

Cíl: Obohatit existující datovou sadu o příznaky vztahující se k textovému sloupci (zachycující sentiment)

Sentiment Analysis v Pythonu

Data recenzí produktů

reviews.head()

prvních 5 řádků recenzí produktů Amazon

Sentiment Analysis v Pythonu

Příznaky ze sloupce recenzí

 

  • Jak dlouhá je každá recenze?
  • Kolik vět obsahuje?
  • Jaké slovní druhy se vyskytují?
  • Kolik interpunkčních znamének?
Sentiment Analysis v Pythonu

Tokenizace řetězce

from nltk import word_tokenize
anna_k = 'Happy families are all alike, every unhappy family is unhappy in its own way.'
word_tokenize(anna_k)

['Happy','families','are', 'all','alike',',',
 'every','unhappy', 'family', 'is','unhappy','in',
 'its','own','way','.']
Sentiment Analysis v Pythonu

Tokeny ze sloupce

# General form of list comprehension
[expression for item in iterable]
word_tokens = [word_tokenize(review) for review in reviews.review]
type(word_tokens)
list
type(word_tokens[0])
list
Sentiment Analysis v Pythonu

Tokeny ze sloupce

len_tokens = []

# Iterate over the word_tokens list
for i in range(len(word_tokens)):
     len_tokens.append(len(word_tokens[i]))

# Create a new feature for the length of each review
reviews['n_tokens'] = len_tokens
Sentiment Analysis v Pythonu

Práce s interpunkcí

  • Interpunkci jsme neřešili, ale lze ji vyloučit
  • Příznak měřící počet interpunkčních znamének
    • Recenze s mnoha interpunkčními znaménky může signalizovat silně emocionální názor
Sentiment Analysis v Pythonu

Recenze s příznakem délky

reviews.head()

prvních 5 řádků recenzí produktů Amazon včetně přidaného sloupce pro délku recenze

Sentiment Analysis v Pythonu

Pojďme procvičovat!

Sentiment Analysis v Pythonu

Preparing Video For Download...