टेक्स्ट से नए फीचर बनाएँ

Python में Sentiment Analysis

Violeta Misheva

Data Scientist

वीडियो का लक्ष्य

 

लक्ष्य: टेक्स्ट कॉलम से जुड़े फीचर जोड़कर मौजूदा डेटासेट समृद्ध करें (sentiment कैप्चर करना)

Python में Sentiment Analysis

प्रोडक्ट रिव्यू डेटा

reviews.head()

Amazon प्रोडक्ट रिव्यूज़ की पहली 5 पंक्तियाँ

Python में Sentiment Analysis

रिव्यू कॉलम से फीचर

 

  • हर रिव्यू कितना लंबा है?
  • इसमें कितने वाक्य हैं?
  • कौन-कौन से parts of speech हैं?
  • कितने punctuation मार्क हैं?
Python में Sentiment Analysis

स्ट्रिंग को tokenize करना

from nltk import word_tokenize
anna_k = 'Happy families are all alike, every unhappy family is unhappy in its own way.'
word_tokenize(anna_k)

['Happy','families','are', 'all','alike',',',
 'every','unhappy', 'family', 'is','unhappy','in',
 'its','own','way','.']
Python में Sentiment Analysis

कॉलम से tokens

# General form of list comprehension
[expression for item in iterable]
word_tokens = [word_tokenize(review) for review in reviews.review]
type(word_tokens)
list
type(word_tokens[0])
list
Python में Sentiment Analysis

कॉलम से tokens

len_tokens = []

# Iterate over the word_tokens list
for i in range(len(word_tokens)):
     len_tokens.append(len(word_tokens[i]))

# Create a new feature for the length of each review
reviews['n_tokens'] = len_tokens
Python में Sentiment Analysis

Punctuation से निपटना

  • हमने इसे कवर नहीं किया, पर आप इसे exclude कर सकते हैं
  • एक फीचर जो punctuation चिह्नों की संख्या मापे
    • बहुत punctuation वाले रिव्यू में अक्सर भावनाएँ तीव्र होती हैं
Python में Sentiment Analysis

रिव्यू: लंबाई वाला फीचर

reviews.head()

Amazon प्रोडक्ट रिव्यू की ऊपर की 5 पंक्तियाँ, जिसमें रिव्यू की लंबाई वाला नया कॉलम शामिल है

Python में Sentiment Analysis

अभ्यास करते हैं!

Python में Sentiment Analysis

Preparing Video For Download...