Python으로 배우는 Sentiment Analysis
Violeta Misheva
Data Scientist
TF: 단어 빈도: 코퍼스에서 한 문서 내 특정 단어가 등장하는 횟수
역문서 빈도 (IDF): 전체 문서 수 대비 특정 단어를 포함한 문서 수의 로그 비율
TfIdf = term frequency * inverse document frequency
# Import the TfidfVectorizer
from sklearn.feature_extraction.text import TfidfVectorizer
vect = TfidfVectorizer(max_features=100).fit(tweets.text)
X = vect.transform(tweets.text)
X
<14640x100 sparse matrix of type '<class 'numpy.float64'>'
with 119182 stored elements in Compressed Sparse Row format>
X_df = pd.DataFrame(X_txt.toarray(), columns=vect.get_feature_names())
X_df.head()
Python으로 배우는 Sentiment Analysis