텍스트로 새 특성 만들기

Python으로 배우는 Sentiment Analysis

Violeta Misheva

Data Scientist

영상의 목표

 

목표: 텍스트 열과 관련된 특성(감정 포착)으로 기존 데이터셋을 확장합니다

Python으로 배우는 Sentiment Analysis

상품 리뷰 데이터

reviews.head()

Amazon 상품 리뷰 상위 5개 행

Python으로 배우는 Sentiment Analysis

리뷰 열에서 만들 특성

 

  • 각 리뷰는 얼마나 긴가요?
  • 문장은 몇 개인가요?
  • 어떤 품사들이 있나요?
  • 문장 부호는 몇 개인가요?
Python으로 배우는 Sentiment Analysis

문자열 토큰화

from nltk import word_tokenize
anna_k = 'Happy families are all alike, every unhappy family is unhappy in its own way.'
word_tokenize(anna_k)

['Happy','families','are', 'all','alike',',',
 'every','unhappy', 'family', 'is','unhappy','in',
 'its','own','way','.']
Python으로 배우는 Sentiment Analysis

열에서 토큰 만들기

# General form of list comprehension
[expression for item in iterable]
word_tokens = [word_tokenize(review) for review in reviews.review]
type(word_tokens)
list
type(word_tokens[0])
list
Python으로 배우는 Sentiment Analysis

열에서 토큰 만들기

len_tokens = []

# Iterate over the word_tokens list
for i in range(len(word_tokens)):
     len_tokens.append(len(word_tokens[i]))

# Create a new feature for the length of each review
reviews['n_tokens'] = len_tokens
Python으로 배우는 Sentiment Analysis

문장 부호 처리

  • 다루지 않았지만 제외할 수 있습니다
  • 문장 부호 개수를 측정하는 특성
    • 문장 부호가 많으면 감정이 강한 의견일 수 있습니다
Python으로 배우는 Sentiment Analysis

리뷰에 길이 특성 추가

reviews.head()

상위 5개 Amazon 상품 리뷰(리뷰 길이 열 추가 포함)

Python으로 배우는 Sentiment Analysis

연습해 봅시다!

Python으로 배우는 Sentiment Analysis

Preparing Video For Download...