토큰 패턴 캡처하기

Python으로 배우는 Sentiment Analysis

Violeta Misheva

Data Scientist

문자열 연산자와 비교

# 문자열이 문자로만 구성되었는지 확인  
my_string.isalpha()
# 문자열이 숫자로만 구성되었는지 확인 
my_string.isdigit()
# 문자열이 영숫자만으로 구성되었는지 확인
my_string.isalnum()
Python으로 배우는 Sentiment Analysis

리스트 컴프리헨션과 문자열 연산자

# 원본 단어 토큰화
word_tokens = [word_tokenize(review) for review in reviews.review]
# 문자로만 된 토큰만 유지
cleaned_tokens = [[word for word in item if word.isalpha()] for item in word_tokens]
len(word_tokens[0])
87
len(cleaned_tokens[0])
78
Python으로 배우는 Sentiment Analysis

정규식

import re
my_string = '#Wonderfulday'
# # 뒤에 대소문자 어떤 글자든 추출
x = re.search('#[A-Za-z]', my_string)
x
<re.Match object; span=(0, 2), match='#W'>
Python으로 배우는 Sentiment Analysis

BOW의 토큰 패턴

# CountVectorizer의 기본 토큰 패턴
'\b\w\w+\b'
# 특정 토큰 패턴 지정
CountVectorizer(token_pattern=r'\b[^\d\W][^\d\W]+\b')
Python으로 배우는 Sentiment Analysis

실습해 봅시다!

Python으로 배우는 Sentiment Analysis

Preparing Video For Download...