spaCy बेसिक्स

spaCy के साथ Natural Language Processing

Azadeh Mobasher

Principal Data Scientist

spaCy NLP पाइपलाइन

import spacy

nlp = spacy.load("en_core_web_sm")
doc = nlp("Here's my spaCy pipeline.")
  • spaCy इम्पोर्ट करें
  • spacy.load() से nlp लौटाएँ, जो Language क्लास है
    • Language ऑब्जेक्ट टेक्स्ट प्रोसेसिंग पाइपलाइन है
  • किसी भी टेक्स्ट पर nlp() चलाएँ और Doc कंटेनर पाएँ
spaCy के साथ Natural Language Processing

spaCy NLP पाइपलाइन

 

spaCy अपनी Language क्लास से कुछ प्रोसेसिंग स्टेप्स लागू करता है:

spaCy Language pipeline

spaCy के साथ Natural Language Processing

spaCy में कंटेनर ऑब्जेक्ट्स

  • spaCy में टेक्स्ट डेटा दर्शाने के कई डेटा स्ट्रक्चर हैं:

 

Name Description
Doc टेक्स्ट के भाषाई एनोटेशन एक्सेस करने का कंटेनर
Span Doc ऑब्जेक्ट का एक स्लाइस
Token एक व्यक्तिगत टोकन, जैसे शब्द, विराम चिह्न, whitespace आदि
spaCy के साथ Natural Language Processing

पाइपलाइन कम्पोनेंट्स

  • spaCy की भाषा प्रोसेसिंग पाइपलाइन लोडेड मॉडल और उसकी क्षमताओं पर निर्भर करती है।

 

Component Name Description
Tokenizer Tokenizer टेक्स्ट को टोकन्स में बाँटें और Doc ऑब्जेक्ट बनाएँ
Tagger Tagger Part-of-speech टैग असाइन करें
Lemmatizer Lemmatizer शब्दों को उनके मूल रूप तक घटाएँ
EntityRecognizer NER नामित एंटिटी पहचानें और लेबल करें
spaCy के साथ Natural Language Processing

पाइपलाइन कम्पोनेंट्स

 

  • हर कम्पोनेंट के अपने फीचर्स होते हैं जो टेक्स्ट प्रोसेस करते हैं

    • Language
    • DependencyParser
    • Sentencizer
spaCy के साथ Natural Language Processing

Tokenization

  • हमेशा पहला ऑपरेशन
  • बाकी सभी ऑपरेशन्स को टोकन्स चाहिए
  • टोकन्स शब्द, संख्या और विराम चिह्न हो सकते हैं
import spacy
nlp = spacy.load("en_core_web_sm")

doc = nlp("Tokenization splits a sentence into its tokens.")

print([token.text for token in doc])
['Tokenization', 'splits', 'a', 'sentence', 'into', 'its', 'tokens', '.']
spaCy के साथ Natural Language Processing

Sentence segmentation

  • Tokenization से अधिक जटिल
  • DependencyParser कम्पोनेंट का हिस्सा
import spacy
nlp = spacy.load("en_core_web_sm")

text = "We are learning NLP. This course introduces spaCy."
doc = nlp(text)

for sent in doc.sents: print(sent.text)
We are learning NLP.
This course introduces spaCy.
spaCy के साथ Natural Language Processing

Lemmatization

  • Lemma किसी टोकन का बेस फॉर्म है
  • eats और ate का lemma eat है
  • भाषा मॉडलों की सटीकता बढ़ती है
import spacy
nlp = spacy.load("en_core_web_sm")
doc = nlp("We are seeing her after one year.")

print([(token.text, token.lemma_) for token in doc])
[('We', 'we'), ('are', 'be'), ('seeing', 'see'), ('her', 'she'), 
('after', 'after'), ('one', 'one'), ('year', 'year'), ('.', '.')]
spaCy के साथ Natural Language Processing

अभ्यास करते हैं!

spaCy के साथ Natural Language Processing

Preparing Video For Download...