टेक्स्ट के लिए प्रीप्रोसेसिंग का परिचय

PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

Shubham Jain

Data Scientist

हम क्या सीखेंगे

  • टेक्स्ट क्लासिफिकेशन
  • टेक्स्ट जनरेशन
  • एन्कोडिंग
  • टेक्स्ट के लिए डीप लर्निंग मॉडल
  • ट्रांसफॉर्मर आर्किटेक्चर
  • मॉडल की सुरक्षा

यूज़ केस:

  • सेंटिमेंट एनालिसिस
  • टेक्स्ट समरीकरण
  • मशीन ट्रांसलेशन

Sentiment Analysis

PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

आपको क्या आना चाहिए

पूर्वापेक्षित कोर्स: Intermediate Deep Learning with PyTorch

  • PyTorch के साथ डीप लर्निंग मॉडल
  • ट्रेनिंग और इवैल्युएशन लूप्स
  • कन्वोल्यूशनल न्यूरल नेटवर्क (CNNs) और रिकरेंट न्यूरल नेटवर्क (RNNs)
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

टेक्स्ट प्रोसेसिंग पाइपलाइन

 

 

Pytorch Processing Pipeline

PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

टेक्स्ट प्रोसेसिंग पाइपलाइन

 

 

Pytorch Processing Pipeline

 

  • टेक्स्ट साफ करें और तैयार करें
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

PyTorch और NLTK

PyTorch Logo

NLTK Logo

  • Natural Language Toolkit
    • रॉ टेक्स्ट को प्रोसेस्ड टेक्स्ट में बदलें
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

प्रीप्रोसेसिंग तकनीकें

  • टोकनाइज़ेशन
  • स्टॉप वर्ड हटाना
  • स्टेमिंग
  • रेयर वर्ड हटाना
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

टोकनाइज़ेशन

  • टेक्स्ट से टोकन या शब्द निकाले जाते हैं
  • torchtext से टोकनाइज़ेशन
from torchtext.data.utils import get_tokenizer

tokenizer = get_tokenizer("basic_english")
tokens = tokenizer("I am reading a book now. I love to read books!") print(tokens)
["I", "am", "reading", "a", "book", "now", ".", "I", "love", "to", "read", 
"books", "!"]
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

स्टॉप वर्ड हटाना

  • ऐसे आम शब्द हटाएँ जो अर्थ में योगदान नहीं देते
  • स्टॉप वर्ड्स: "a", "the", "and", "or", आदि
import nltk
nltk.download('stopwords')
from nltk.corpus import stopwords

stop_words = set(stopwords.words('english'))
tokens = ["I", "am", "reading", "a", "book", "now", ".", "I", "love", "to", "read", "books", "!"] filtered_tokens = [token for token in tokens if token.lower() not in stop_words]
print(filtered_tokens)
["reading", "book", ".", "love", "read", "books", "!"]
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

स्टेमिंग

  • शब्दों को उनके मूल रूप में लाना
  • उदाहरण: "running", "runs", "ran" बनते हैं run
import nltk
from nltk.stem import PorterStemmer

stemmer = PorterStemmer()
filtered_tokens = ["reading", "book", ".", "love", "read", "books", "!"]
stemmed_tokens = [stemmer.stem(token) for token in filtered_tokens]
print(stemmed_tokens)
["read", "book", ".", "love", "read", "book", "!"]
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

रेयर वर्ड हटाना

  • कम आवृत्ति वाले शब्द हटाना जो मूल्य नहीं जोड़ते
from nltk.probability import FreqDist
stemmed_tokens= ["read", "book", ".", "love", "read", "book", "!"]  
freq_dist = FreqDist(stemmed_tokens)

threshold = 2
common_tokens = [token for token in stemmed_tokens if freq_dist[token] > threshold] print(common_tokens)
["read", "book", "read", "book"]
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

प्रीप्रोसेसिंग तकनीकें

टोकनाइज़ेशन, स्टॉपवर्ड हटाना, स्टेमिंग, और रेयर वर्ड हटाना

  • फीचर घटाएँ
  • साफ, ज्यादा प्रतिनिधि डेटासेट
  • और भी तकनीकें मौजूद हैं
PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

अभ्यास करते हैं!

PyTorch के साथ टेक्स्ट के लिए डीप लर्निंग

Preparing Video For Download...