Anpassa spaCy-modeller

Naturlig språkbehandling med spaCy

Azadeh Mobasher

Principal data scientist

Varför träna spaCy-modeller?

  • Fungerar bra för allmänna NLP-användningsfall
  • Men kan sakna data från specifika domäner i sin träning, t.ex.
    • Twitter-data
    • Medicinsk data

Exempel på NER inom medicinsk domän

Naturlig språkbehandling med spaCy

Varför träna spaCy-modeller?

 

  • Bättre resultat inom din specifika domän
  • Nödvändigt för domänspecifik textklassificering

 

Innan du börjar träna, ställ dig dessa frågor:

  • Presterar spaCy-modeller tillräckligt bra på vår data?
  • Innehåller vår domän många etiketter som saknas i spaCy-modeller?
Naturlig språkbehandling med spaCy

Modellernas prestanda på vår data

  • Presterar spaCy-modeller tillräckligt bra på vår data?
  • Oxford Street klassificeras inte korrekt med etiketten GPE:
import spacy
nlp = spacy.load("en_core_web_sm")

text = "The car was navigating to the Oxford Street."
doc = nlp(text)
print([(ent.text, ent.label_) for ent in doc.ents])
[('the Oxford Street', 'ORG')]
Naturlig språkbehandling med spaCy

Utdataetiketter i spaCy-modeller

  • Innehåller vår domän många etiketter som saknas i spaCy-modeller?

NER-exempel från allmän respektive medicinsk domän

Naturlig språkbehandling med spaCy

Utdataetiketter i spaCy-modeller

 

Om vi behöver anpassad modellträning följer vi dessa steg:

  • Samla in domänspecifik data
  • Annotera vår data
  • Bestäm om vi ska uppdatera en befintlig modell eller träna från grunden
Naturlig språkbehandling med spaCy

Nu kör vi en övning!

Naturlig språkbehandling med spaCy

Preparing Video For Download...