spaCy के साथ Natural Language Processing
Azadeh Mobasher
Principal Data Scientist
import spacynlp = spacy.load("en_core_web_sm")doc = nlp("Here's my spaCy pipeline.")
spaCy इम्पोर्ट करेंspacy.load() से nlp लौटाएँ, जो Language क्लास हैLanguage ऑब्जेक्ट टेक्स्ट प्रोसेसिंग पाइपलाइन हैnlp() चलाएँ और Doc कंटेनर पाएँ
spaCy अपनी Language क्लास से कुछ प्रोसेसिंग स्टेप्स लागू करता है:
spaCy में टेक्स्ट डेटा दर्शाने के कई डेटा स्ट्रक्चर हैं:
| Name | Description |
|---|---|
Doc |
टेक्स्ट के भाषाई एनोटेशन एक्सेस करने का कंटेनर |
Span |
Doc ऑब्जेक्ट का एक स्लाइस |
Token |
एक व्यक्तिगत टोकन, जैसे शब्द, विराम चिह्न, whitespace आदि |
spaCy की भाषा प्रोसेसिंग पाइपलाइन लोडेड मॉडल और उसकी क्षमताओं पर निर्भर करती है।
| Component | Name | Description |
|---|---|---|
| Tokenizer | Tokenizer | टेक्स्ट को टोकन्स में बाँटें और Doc ऑब्जेक्ट बनाएँ |
| Tagger | Tagger | Part-of-speech टैग असाइन करें |
| Lemmatizer | Lemmatizer | शब्दों को उनके मूल रूप तक घटाएँ |
| EntityRecognizer | NER | नामित एंटिटी पहचानें और लेबल करें |
हर कम्पोनेंट के अपने फीचर्स होते हैं जो टेक्स्ट प्रोसेस करते हैं
import spacy nlp = spacy.load("en_core_web_sm") doc = nlp("Tokenization splits a sentence into its tokens.")print([token.text for token in doc])
['Tokenization', 'splits', 'a', 'sentence', 'into', 'its', 'tokens', '.']
DependencyParser कम्पोनेंट का हिस्साimport spacy nlp = spacy.load("en_core_web_sm") text = "We are learning NLP. This course introduces spaCy." doc = nlp(text)for sent in doc.sents: print(sent.text)
We are learning NLP.
This course introduces spaCy.
import spacy nlp = spacy.load("en_core_web_sm") doc = nlp("We are seeing her after one year.")print([(token.text, token.lemma_) for token in doc])
[('We', 'we'), ('are', 'be'), ('seeing', 'see'), ('her', 'she'),
('after', 'after'), ('one', 'one'), ('year', 'year'), ('.', '.')]
spaCy के साथ Natural Language Processing