Mô hình chủ đề về gian lận

Phát hiện gian lận với Python

Charlotte Werger

Data Scientist

Mô hình chủ đề: khám phá mẫu ẩn trong văn bản

  1. Khai phá chủ đề trong văn bản
  2. "Văn bản nói về điều gì"
  3. Tương tự phân cụm về mặt khái niệm
  4. So sánh chủ đề giữa ca gian lận và không gian lận, dùng làm đặc trưng/cờ
  5. Hoặc... có chủ đề nào gợi ý gian lận?
Phát hiện gian lận với Python

Latent Dirichlet Allocation (LDA)

Với LDA, bạn nhận được:

  1. Mô hình "chủ đề cho mỗi văn bản" (xác suất)
  2. Mô hình "từ cho mỗi chủ đề"

Tạo mô hình chủ đề của riêng bạn:

  1. Làm sạch dữ liệu
  2. Tạo bag-of-words với dictionary và corpus
  3. Đưa dictionary và corpus vào mô hình LDA
Phát hiện gian lận với Python

Latent Dirichlet Allocation (LDA)

Phát hiện gian lận với Python

Bag-of-words: dictionary và corpus

from gensim import corpora
# Tạo dictionary: số lần mỗi từ xuất hiện
dictionary = corpora.Dictionary(cleaned_emails)
# Lọc từ (không) thường xuyên 
dictionary.filter_extremes(no_below=5, keep_n=50000)
# Tạo corpus
corpus = [dictionary.doc2bow(text) for text in cleaned_emails]
Phát hiện gian lận với Python

LDA với gensim

import gensim
# Định nghĩa mô hình LDA
ldamodel = gensim.models.ldamodel.LdaModel(corpus, num_topics = 3, 
id2word=dictionary, passes=15)
# In 3 chủ đề với các từ nổi bật
topics = ldamodel.print_topics(num_words=4)
for topic in topics:
    print(topic)
(0, 0.029*"email" + 0.016*"send" + 0.016*"results" + 0.016*"invoice")
(1, 0.026*"price" + 0.026*"work" + 0.026*"management" + 0.026*"sell")
(2, 0.029*"distribute" + 0.029*"contact" + 0.016*"supply" + 0.016*"fast")
Phát hiện gian lận với Python

Ayo berlatih!

Phát hiện gian lận với Python

Preparing Video For Download...