Phân loại văn bản

Làm việc với Hugging Face

Jacob H. Marquez

Lead Data Engineer

Phân loại văn bản: Phân tích cảm xúc

$$

  • Gán nhãn văn bản theo sắc thái cảm xúc

$$

Phân tích cảm xúc

$$

  • Ứng dụng: phân tích đánh giá, theo dõi cảm xúc mạng xã hội

Biểu tượng cảm xúc

Làm việc với Hugging Face

Phân tích cảm xúc: ví dụ mã

from transformers import pipeline

my_pipeline = pipeline( "text-classification", model="distilbert-base-uncased-finetuned-sst-2-english" )
print(my_pipeline("Wi-Fi is slower than a snail today!"))
[{'label': 'NEGATIVE', 'score': 0.99}]
Làm việc với Hugging Face

Phân loại văn bản: Độ đúng ngữ pháp

$$

Kiểm tra ngữ pháp

$$

  • Đánh giá độ đúng của ngữ pháp văn bản

$$

Ví dụ về độ đúng ngữ pháp

$$

  • Ứng dụng: trình kiểm tra ngữ pháp, công cụ học ngôn ngữ
Làm việc với Hugging Face

Độ đúng ngữ pháp: ví dụ mã

from transformers import pipeline


# Create a pipeline for grammar checking grammar_checker = pipeline( task="text-classification", model="abdulmatinomotoso/English_Grammar_Checker" )
# Check grammar of the input text print(grammar_checker("He eat pizza every day."))
[{'label': 'LABEL_0', 'score': 0.99}]
Làm việc với Hugging Face

Phân loại văn bản: QNLI

$$ Hỏi đáp

$$

$$

  • Kiểm tra xem mệnh đề có trả lời câu hỏi không

  • Ứng dụng: hệ thống hỏi đáp, kiểm chứng thông tin

Ví dụ QNLI

Làm việc với Hugging Face

QNLI: ví dụ mã

from transformers import pipeline


classifier = pipeline( task="text-classification", model="cross-encoder/qnli-electra-base" )
classifier("Where is Seattle located?, Seattle is located in Washington state.")
[{'label': 'LABEL_0', 'score': 0.997}]
Làm việc với Hugging Face

Phân loại văn bản: Gán danh mục động

$$

  • Gán danh mục động dựa trên nội dung

Ví dụ gán danh mục

  • Ứng dụng: kiểm duyệt nội dung, hệ thống gợi ý

$$

Gán danh mục

Làm việc với Hugging Face

Gán danh mục động: ví dụ mã

classifier = pipeline(
  task="zero-shot-classification", 
  model="facebook/bart-large-mnli")


text = "Hey, DataCamp; we would like to feature your courses in our newsletter!" categories = ["marketing", "sales", "support"]
output = classifier(text, categories)
print(f"Top Label: {output['labels'][0]} with score: {output['scores'][0]}")
Top Label: support with score: 0.8183
Làm việc với Hugging Face

Thách thức của phân loại văn bản

Mơ hồ

Làm việc với Hugging Face

Thách thức của phân loại văn bản

Mỉa mai

Làm việc với Hugging Face

Thách thức của phân loại văn bản

Đa ngôn ngữ

Làm việc với Hugging Face

Ayo berlatih!

Làm việc với Hugging Face

Preparing Video For Download...