Úvod do SpaCy

Úvod do zpracování přirozeného jazyka v Pythonu

Katharine Jarmul

Founder, kjamistan

Co je SpaCy?

  • Knihovna NLP podobná gensim, s odlišnou implementací
  • Zaměřena na tvorbu NLP pipeline pro generování modelů a korpusů
  • Open-source, s dalšími knihovnami a nástroji
    • Displacy
Úvod do zpracování přirozeného jazyka v Pythonu

Vizualizér rozpoznávání entit Displacy

Úvod do zpracování přirozeného jazyka v Pythonu
import spacy

nlp = spacy.load('en_core_web_sm')
nlp.entity
<spacy.pipeline.EntityRecognizer at 0x7f76b75e68b8>
doc = nlp("""Berlin is the capital of Germany; 
                  and the residence of Chancellor Angela Merkel.""")

doc.ents
(Berlin, Germany, Angela Merkel)
print(doc.ents[0], doc.ents[0].label_)
Berlin GPE
Úvod do zpracování přirozeného jazyka v Pythonu

Proč používat SpaCy pro NER?

  • Snadná tvorba pipeline
  • Odlišné typy entit oproti nltk
  • Korpusy neformálního jazyka
    • Snadné vyhledávání entit v tweetech a chatových zprávách
  • Rychle se rozvíjí!
Úvod do zpracování přirozeného jazyka v Pythonu

Pojďme si procvičit!

Úvod do zpracování přirozeného jazyka v Pythonu

Preparing Video For Download...