Sentiment Analysis v Pythonu
Violeta Misheva
Data Scientist
Jsem šťastný, ne smutný.
Jsem smutný, ne šťastný.
Unigramy: jednotlivé tokeny
Bigramy: dvojice tokenů
Trigramy: trojice tokenů
N-gramy: sekvence n tokenů
Dnes je nádherné počasí.
Unigramy: { Dnes, je, nádherné, počasí }
Bigramy: { Dnes je, je nádherné, nádherné počasí }
Trigramy: { Dnes je nádherné, je nádherné počasí }
from sklearn.feature_extraction.text import CountVectorizer
vect = CountVectorizer(ngram_range=(min_n, max_n))
# Only unigrams
ngram_range=(1, 1)
# Uni- and bigrams
ngram_range=(1, 2)
CountVectorizer(max_features, max_df, min_df)
Sentiment Analysis v Pythonu