สร้างฟีเจอร์ใหม่จากข้อความ

Sentiment Analysis ด้วย Python

Violeta Misheva

Data Scientist

เป้าหมายของวิดีโอ

 

เป้าหมาย : เพิ่มฟีเจอร์ที่เกี่ยวกับคอลัมน์ข้อความ (เพื่อจับ sentiment) ลงในชุดข้อมูลที่มีอยู่

Sentiment Analysis ด้วย Python

ข้อมูลรีวิวสินค้า

reviews.head()

5 แถวแรกของรีวิวสินค้า Amazon

Sentiment Analysis ด้วย Python

ฟีเจอร์จากคอลัมน์รีวิว

 

  • รีวิวแต่ละชิ้นมีความยาวเท่าไร?
  • มีกี่ประโยค?
  • มีคำประเภทใด (parts of speech) บ้าง?
  • มีเครื่องหมายวรรคตอนกี่ตัว?
Sentiment Analysis ด้วย Python

การ tokenize สตริง

from nltk import word_tokenize
anna_k = 'Happy families are all alike, every unhappy family is unhappy in its own way.'
word_tokenize(anna_k)

['Happy','families','are', 'all','alike',',',
 'every','unhappy', 'family', 'is','unhappy','in',
 'its','own','way','.']
Sentiment Analysis ด้วย Python

Token จากคอลัมน์

# General form of list comprehension
[expression for item in iterable]
word_tokens = [word_tokenize(review) for review in reviews.review]
type(word_tokens)
list
type(word_tokens[0])
list
Sentiment Analysis ด้วย Python

Token จากคอลัมน์

len_tokens = []

# Iterate over the word_tokens list
for i in range(len(word_tokens)):
     len_tokens.append(len(word_tokens[i]))

# Create a new feature for the length of each review
reviews['n_tokens'] = len_tokens
Sentiment Analysis ด้วย Python

การจัดการเครื่องหมายวรรคตอน

  • ยังไม่ได้จัดการในที่นี้ แต่สามารถตัดออกได้
  • ฟีเจอร์ที่นับจำนวนเครื่องหมายวรรคตอน
    • รีวิวที่มีเครื่องหมายวรรคตอนมากอาจบ่งบอกถึงความคิดเห็นที่มีอารมณ์รุนแรง
Sentiment Analysis ด้วย Python

รีวิวพร้อมฟีเจอร์ความยาว

reviews.head()

5 แถวแรกของรีวิวสินค้า Amazon รวมถึงคอลัมน์ที่เพิ่มมาสำหรับความยาวของรีวิว

Sentiment Analysis ด้วย Python

มาฝึกกันเถอะ!

Sentiment Analysis ด้วย Python

Preparing Video For Download...