언어를 맞혀보세요

Python으로 배우는 Sentiment Analysis

Violeta Misheva

Data Scientist

Python에서 문자열의 언어

from langdetect import detect_langs 
foreign = 'Este libro ha sido uno de los mejores libros que he leido.'
detect_langs(foreign)
[es:0.9999945352697024]
Python으로 배우는 Sentiment Analysis

열의 언어 감지

  • 과제: 각 문자열의 언어를 감지하여 가장 가능성이 높은 언어를 새 열에 저장합니다
from langdetect import detect_langs 
reviews = pd.read_csv('product_reviews.csv')
reviews.head()

아마존 상품 리뷰 상위 5행

Python으로 배우는 Sentiment Analysis

언어 특징 만들기

languages = []
for row in range(len(reviews)):
    languages.append(detect_langs(reviews.iloc[row, 1]))
languages
[it:0.9999982541301151],
[es:0.9999954153640488],
[es:0.7142833997345875, en:0.2857160465706441],
[es:0.9999942365605781],
[es:0.999997956049055] ...
Python으로 배우는 Sentiment Analysis

언어 특징 만들기

# 첫 번째 리스트를 문자열로 변환하고 콜론 기준으로 분할
str(languages[0]).split(':') 
['[es', '0.9999954153640488]']
str(languages[0]).split(':')[0]
'[es'
str(languages[0]).split(':')[0][1:]
'es'
Python으로 배우는 Sentiment Analysis

언어 특징 만들기

languages = [str(lang).split(':')[0][1:] for lang in languages]
reviews['language'] = languages
Python으로 배우는 Sentiment Analysis

연습해 봅시다!

Python으로 배우는 Sentiment Analysis

Preparing Video For Download...