Анализ тональности текста на Python
Violeta Misheva
Data Scientist
Я счастлив, не грустен.
Я грустен, не счастлив.
Унiграммы : отдельные токены
Биграммы: пары токенов
Триграммы: тройки токенов
n-граммы: последовательность из n токенов
Сегодня прекрасная погода.
Униграммы : { Сегодня, прекрасная, погода }
Биграммы: { Сегодня прекрасная, прекрасная погода }
Триграммы: { Сегодня прекрасная погода }
from sklearn.feature_extraction.text import CountVectorizer
vect = CountVectorizer(ngram_range=(min_n, max_n))
# Only unigrams
ngram_range=(1, 1)
# Uni- and bigrams
ngram_range=(1, 2)
CountVectorizer(max_features, max_df, min_df)
Анализ тональности текста на Python