Створення нових ознак з тексту

Аналіз тональності в Python

Violeta Misheva

Data Scientist

Мета відео

 

Мета: збагатити наявний набір даних ознаками з текстового стовпця (зафіксувати сентимент)

Аналіз тональності в Python

Дані відгуків про товари

reviews.head()

перші 5 рядків відгуків на товари Amazon

Аналіз тональності в Python

Ознаки зі стовпця відгуків

 

  • Якої довжини кожен відгук?
  • Скільки в ньому речень?
  • Які частини мови вжито?
  • Скільки розділових знаків?
Аналіз тональності в Python

Токенізація рядка

from nltk import word_tokenize
anna_k = 'Happy families are all alike, every unhappy family is unhappy in its own way.'
word_tokenize(anna_k)

['Happy','families','are', 'all','alike',',',
 'every','unhappy', 'family', 'is','unhappy','in',
 'its','own','way','.']
Аналіз тональності в Python

Токени зі стовпця

# General form of list comprehension
[expression for item in iterable]
word_tokens = [word_tokenize(review) for review in reviews.review]
type(word_tokens)
list
type(word_tokens[0])
list
Аналіз тональності в Python

Токени зі стовпця

len_tokens = []

# Iterate over the word_tokens list
for i in range(len(word_tokens)):
     len_tokens.append(len(word_tokens[i]))

# Create a new feature for the length of each review
reviews['n_tokens'] = len_tokens
Аналіз тональності в Python

Робота з пунктуацією

  • Ми цього не розглядали, але його можна вилучити
  • Ознака, що рахує кількість розділових знаків
    • Відгук із багатьма розділовими знаками може свідчити про дуже емоційну думку
Аналіз тональності в Python

Відгуки з ознакою довжини

reviews.head()

перші 5 рядків відгуків Amazon, включно з доданим стовпцем довжини відгуку

Аналіз тональності в Python

Давайте потренуємось!

Аналіз тональності в Python

Preparing Video For Download...