Tách từ và chuẩn hóa gốc từ

Khai thác đặc trưng cho NLP bằng Python

Rounak Banik

Data Scientist

Nguồn văn bản

  • Bài báo
  • Tweet
  • Bình luận
Khai thác đặc trưng cho NLP bằng Python

Làm văn bản thân thiện với máy

  • Dogs, dog
  • reduction, REDUCING, Reduce
  • don't, do not
  • won't, will not
Khai thác đặc trưng cho NLP bằng Python

Kỹ thuật tiền xử lý văn bản

  • Chuyển chữ về dạng thường
  • Xóa khoảng trắng đầu/cuối
  • Loại bỏ dấu câu
  • Loại bỏ stopword
  • Mở rộng từ viết tắt
  • Loại bỏ ký tự đặc biệt (số, emoji, v.v.)
Khai thác đặc trưng cho NLP bằng Python

Tách từ (Tokenization)

"I have a dog. His name is Hachi."

Token:

["I", "have", "a", "dog", ".", "His", "name", "is", "Hachi", "."]
"Don't do this."

Token:

["Do", "n't", "do", "this", "."]
Khai thác đặc trưng cho NLP bằng Python

Tách từ với spaCy

import spacy

# Load the en_core_web_sm model nlp = spacy.load('en_core_web_sm')
# Initiliaze string string = "Hello! I don't know what I'm doing here."
# Create a Doc object doc = nlp(string)
# Generate list of tokens tokens = [token.text for token in doc] print(tokens)
['Hello','!','I','do',"n't",'know','what','I',"'m",'doing','here','.']
Khai thác đặc trưng cho NLP bằng Python

Chuẩn hóa gốc từ (Lemmatization)

  • Chuyển từ về dạng gốc
    • reducing, reduces, reduced, reductionreduce
    • am, are, isbe
    • n'tnot
    • 'vehave
Khai thác đặc trưng cho NLP bằng Python

Chuẩn hóa gốc từ với spaCy

import spacy

# Load the en_core_web_sm model
nlp = spacy.load('en_core_web_sm')
# Initiliaze string
string = "Hello! I don't know what I'm doing here."
# Create a Doc object
doc = nlp(string)

# Generate list of lemmas lemmas = [token.lemma_ for token in doc] print(lemmas)
['hello','!','-PRON-','do','not','know','what','-PRON','be','do','here', '.']
Khai thác đặc trưng cho NLP bằng Python

Ayo berlatih!

Khai thác đặc trưng cho NLP bằng Python

Preparing Video For Download...