Python 中文本特徵工程
Rounak Banik
Data Scientist
Dogs, dogreduction, REDUCING, Reducedon't, do notwon't, will not"I have a dog. His name is Hachi."
詞元(Tokens):
["I", "have", "a", "dog", ".", "His", "name", "is", "Hachi", "."]
"Don't do this."
詞元(Tokens):
["Do", "n't", "do", "this", "."]
import spacy# 載入 en_core_web_sm 模型 nlp = spacy.load('en_core_web_sm')# 初始化字串 string = "Hello! I don't know what I'm doing here."# 建立 Doc 物件 doc = nlp(string)# 產生詞元清單 tokens = [token.text for token in doc] print(tokens)
['Hello','!','I','do',"n't",'know','what','I',"'m",'doing','here','.']
reducing, reduces, reduced, reduction → reduceam, are, is → ben't → not've → haveimport spacy # 載入 en_core_web_sm 模型 nlp = spacy.load('en_core_web_sm') # 初始化字串 string = "Hello! I don't know what I'm doing here." # 建立 Doc 物件 doc = nlp(string)# 產生詞元的詞形還原清單 lemmas = [token.lemma_ for token in doc] print(lemmas)
['hello','!','-PRON-','do','not','know','what','-PRON','be','do','here', '.']
Python 中文本特徵工程