Tùy chỉnh mô hình spaCy

Xử lý ngôn ngữ tự nhiên với spaCy

Azadeh Mobasher

Principal data scientist

Vì sao huấn luyện mô hình spaCy?

  • Hiệu quả cho các bài toán NLP tổng quát
  • Nhưng có thể không thấy dữ liệu chuyên ngành trong quá trình huấn luyện, ví dụ:
    • Dữ liệu Twitter
    • Dữ liệu y khoa

Ví dụ NER trong lĩnh vực y khoa

Xử lý ngôn ngữ tự nhiên với spaCy

Vì sao huấn luyện mô hình spaCy?

 

  • Kết quả tốt hơn trên miền dữ liệu của bạn
  • Cần thiết cho phân loại văn bản theo miền

 

Trước khi huấn luyện, hãy hỏi:

  • Mô hình spaCy đã đủ tốt trên dữ liệu của chúng ta chưa?
  • Miền của chúng ta có nhiều nhãn mà spaCy không có không?
Xử lý ngôn ngữ tự nhiên với spaCy

Hiệu năng mô hình trên dữ liệu của chúng ta

  • Mô hình spaCy đã đủ tốt trên dữ liệu của chúng ta chưa?
  • Oxford Street không được gán đúng nhãn GPE:
import spacy
nlp = spacy.load("en_core_web_sm")

text = "The car was navigating to the Oxford Street."
doc = nlp(text)
print([(ent.text, ent.label_) for ent in doc.ents])
[('the Oxford Street', 'ORG')]
Xử lý ngôn ngữ tự nhiên với spaCy

Nhãn đầu ra trong mô hình spaCy

  • Miền của chúng ta có nhiều nhãn mà spaCy không có không?

Ví dụ NER ở miền chung vs. y khoa

Xử lý ngôn ngữ tự nhiên với spaCy

Nhãn đầu ra trong mô hình spaCy

 

Nếu cần huấn luyện tùy chỉnh, làm theo các bước sau:

  • Thu thập dữ liệu theo miền
  • Gán nhãn dữ liệu
  • Quyết định cập nhật mô hình có sẵn hay huấn luyện từ đầu
Xử lý ngôn ngữ tự nhiên với spaCy

Ayo berlatih!

Xử lý ngôn ngữ tự nhiên với spaCy

Preparing Video For Download...