Přizpůsobení modelů spaCy

Zpracování přirozeného jazyka s knihovnou spaCy

Azadeh Mobasher

Principal data scientist

Proč trénovat modely spaCy?

  • Pro obecné NLP úlohy jsou dostačující
  • Ale nemusí obsahovat data ze specifických domén, např.
    • Data z Twitteru
    • Medicínská data

Příklad NER v medicínské doméně

Zpracování přirozeného jazyka s knihovnou spaCy

Proč trénovat modely spaCy?

 

  • Lepší výsledky ve specifické doméně
  • Nezbytné pro doménovou klasifikaci textu

 

Před zahájením tréninku si položte tyto otázky:

  • Jsou modely spaCy dostatečně přesné pro naše data?
  • Obsahuje naše doména mnoho štítků, které modely spaCy nezahrnují?
Zpracování přirozeného jazyka s knihovnou spaCy

Výkonnost modelů na našich datech

  • Jsou modely spaCy dostatečně přesné pro naše data?
  • Oxford Street není správně klasifikována štítkem GPE:
import spacy
nlp = spacy.load("en_core_web_sm")

text = "The car was navigating to the Oxford Street."
doc = nlp(text)
print([(ent.text, ent.label_) for ent in doc.ents])
[('the Oxford Street', 'ORG')]
Zpracování přirozeného jazyka s knihovnou spaCy

Výstupní štítky v modelech spaCy

  • Obsahuje naše doména mnoho štítků, které modely spaCy nezahrnují?

Příklad NER: obecná vs. medicínská doména

Zpracování přirozeného jazyka s knihovnou spaCy

Výstupní štítky v modelech spaCy

 

Pokud potřebujeme vlastní trénink modelu, postupujeme takto:

  • Shromáždíme doménově specifická data
  • Anotujeme data
  • Rozhodneme se, zda aktualizovat existující model, nebo trénovat od začátku
Zpracování přirozeného jazyka s knihovnou spaCy

Pojďme si procvičit!

Zpracování přirozeného jazyka s knihovnou spaCy

Preparing Video For Download...