Analyse de sentiment en Python
Violeta Misheva
Data Scientist
# Vérifie si une chaîne ne contient que des lettres
my_string.isalpha()
# Vérifie si une chaîne ne contient que des chiffres
my_string.isdigit()
# Vérifie si une chaîne ne contient que des caractères alphanumériques
my_string.isalnum()
# Tokenisation initiale des mots
word_tokens = [word_tokenize(review) for review in reviews.review]
# Conserver uniquement les jetons composés de lettres
cleaned_tokens = [[word for word in item if word.isalpha()] for item in word_tokens]
len(word_tokens[0])
87
len(cleaned_tokens[0])
78
import re
my_string = '#Wonderfulday'
# Extraire # suivi de n'importe quelle lettre, minuscule ou majuscule
x = re.search('#[A-Za-z]', my_string)
x
<re.Match object; span=(0, 2), match='#W'>
# Motif de jeton par défaut dans CountVectorizer
'\b\w\w+\b'
# Spécifier un motif de jeton particulier
CountVectorizer(token_pattern=r'\b[^\d\W][^\d\W]+\b')
Analyse de sentiment en Python