Zpracování přirozeného jazyka s knihovnou spaCy
Azadeh Mobasher
Principal Data Scientist
Analýza sentimentu
Rozpoznávání pojmenovaných entit (NER)
spaCy je bezplatná, open-source knihovna pro NLP v Pythonu, která:
spaCy lze nainstalovat pomocí správce balíčků pipspaCy lze stáhnout
$ python3 pip install spacy
python3 -m spacy download en_core_web_sm
import spacy
nlp = spacy.load("en_core_web_sm")
spaCy en_core_web_sm = objekt nlpnlp převádí text na objekt Doc (kontejner) pro uložení zpracovaného textu
spaCyimport spacy
nlp = spacy.load("en_core_web_sm")
text = "A spaCy pipeline object is created."
doc = nlp(text)
Token je nejmenší smysluplná část textu.print([token.text for token in doc])
['A', 'spaCy', 'pipeline', 'object', 'is', 'created', '.']
Zpracování přirozeného jazyka s knihovnou spaCy