Riconoscimento entità su testo trascritto

Elaborazione del linguaggio parlato in Python

Daniel Bourke

Machine Learning Engineer/YouTube Creator

Installare spaCy

# Installa spaCy
$ pip install spacy
# Scarica il modello lingua di spaCy
$ python -m spacy download en_core_web_sm
Elaborazione del linguaggio parlato in Python

Usare spaCy

import spacy

# Carica il modello lingua di spaCy nlp = spacy.load("en_core_web_sm")
# Crea un doc spaCy
doc = nlp("I'd like to talk about a smartphone I ordered on July 31st from your 
Sydney store, my order number is 40939440. I spoke to Georgia about it last week.")
Elaborazione del linguaggio parlato in Python

Token in spaCy

# Mostra token e posizioni
for token in doc:
  print(token.text, token.idx)
I 0
'd 1
like 4
to 9
talk 12
about 17
a 23
smartphone 25...
Elaborazione del linguaggio parlato in Python

Frasi in spaCy

# Mostra le frasi nel doc
for sentences in doc.sents:
  print(sentence)
I'd like to talk about a smartphone I ordered on July 31st from your Sydney store, 
my order number is 4093829.
I spoke to one of your customer service team, Georgia, yesterday.
Elaborazione del linguaggio parlato in Python

Entità nominate di spaCy

Alcune entità nominate integrate di spaCy:

  • PERSON Persone, anche personaggi.
  • ORG Aziende, agenzie, istituzioni, ecc.
  • GPE Paesi, città, stati.
  • PRODUCT Oggetti, veicoli, cibi, ecc. (non servizi)
  • DATE Date o periodi assoluti o relativi.
  • TIME Orari inferiori a un giorno.
  • MONEY Valori monetari, incl. unità.
  • CARDINAL Numeri che non rientrano in altri tipi.
Elaborazione del linguaggio parlato in Python

Entità nominate di spaCy

# Trova le entità nel doc
for entity in doc.ents:
  print(entity.text, entity.label_)
July 31st DATE
Sydney GPE
4093829 CARDINAL
one CARDINAL
Georgia GPE
yesterday DATE
Elaborazione del linguaggio parlato in Python

Entità personalizzate

# Importa la classe EntityRuler
from spacy.pipeline import EntityRuler
# Controlla la pipeline di spaCy
print(nlp.pipeline)
[('tagger', <spacy.pipeline.pipes.Tagger at 0x1c3aa8a470>),
 ('parser', <spacy.pipeline.pipes.DependencyParser at 0x1c3bb60588>),
 ('ner', <spacy.pipeline.pipes.EntityRecognizer at 0x1c3bb605e8>)]
Elaborazione del linguaggio parlato in Python

Modificare la pipeline

# Crea un'istanza di EntityRuler
ruler = EntityRuler(nlp)
# Aggiungi uno schema di token al ruler
ruler.add_patterns([{"label":"PRODUCT", "pattern": "smartphone"}])
# Aggiungi la nuova regola alla pipeline prima di ner
nlp.add_pipe(ruler, before="ner")
# Controlla la pipeline aggiornata
nlp.pipeline
Elaborazione del linguaggio parlato in Python

Modificare la pipeline

[('tagger', <spacy.pipeline.pipes.Tagger at 0x1c1f9c9b38>),
 ('parser', <spacy.pipeline.pipes.DependencyParser at 0x1c3c9cba08>),
 ('entity_ruler', <spacy.pipeline.entityruler.EntityRuler at 0x1c1d834b70>),
 ('ner', <spacy.pipeline.pipes.EntityRecognizer at 0x1c3c9cba68>)]
Elaborazione del linguaggio parlato in Python

Testare la nuova pipeline

# Testa la nuova regola
for entity in doc.ents:
    print(entity.text, entity.label_)
smartphone PRODUCT
July 31st DATE
Sydney GPE
4093829 CARDINAL
one CARDINAL
Georgia GPE
yesterday DATE
Elaborazione del linguaggio parlato in Python

Partiamo e pratichiamo con spaCy!

Elaborazione del linguaggio parlato in Python

Preparing Video For Download...