TfIdf:更多文本转换方法

Python 中的情感分析

Violeta Misheva

Data Scientist

TfIdf 的组成是什么?

  • TF:词频:某个词在语料库中一篇文档内出现的次数

  • 逆文档频率(IDF):总文档数与包含该词的文档数的对数比

    • 用于衡量不常见词的权重
Python 中的情感分析

词的 TfIdf 分数

  • TfIdf 分数
TfIdf = term frequency * inverse document frequency
  • BOW 不考虑文档长度;TfIdf 会考虑。
  • TfIdf 倾向于捕捉在某篇文档内常见、但在跨文档中不常见的词。
Python 中的情感分析

TfIdf 有何用?

推特航空公司情感
  • 低 TfIdf 分数:United、Virgin America
  • 高 TfIdf 分数:check-in process(若跨文档罕见)
更多关于 TfIdf
  • 因为会惩罚高频词,通常无需单独处理停用词。
  • 在搜索与信息检索中用于按相关性排序结果,非常有用。
Python 中的情感分析

Python 中的 TfIdf

# Import the TfidfVectorizer
from sklearn.feature_extraction.text import TfidfVectorizer
  • TfidfVectorizer 的参数:max_features、ngram_range、stop_words、token_pattern、max_df、min_df
vect = TfidfVectorizer(max_features=100).fit(tweets.text)
X = vect.transform(tweets.text)
Python 中的情感分析

TfidfVectorizer

X
<14640x100 sparse matrix of type '<class 'numpy.float64'>'
    with 119182 stored elements in Compressed Sparse Row format>
X_df = pd.DataFrame(X_txt.toarray(), columns=vect.get_feature_names())
X_df.head()

使用 TfIdf 生成的数据前 5 行

Python 中的情感分析

让我们来练习!

Python 中的情感分析

Preparing Video For Download...