Thuật toán phát hiện gian lận trong thực tiễn

Phát hiện gian lận với Python

Charlotte Werger

Data Scientist

Phát hiện gian lận truyền thống bằng hệ thống dựa trên luật

Phát hiện gian lận với Python

Nhược điểm của hệ thống dựa trên luật

Hệ thống dựa trên luật có hạn chế:

  1. Ngưỡng cố định cho từng luật để xác định gian lận
  2. Chỉ cho kết quả có/không
  3. Không nắm bắt tương tác giữa các đặc trưng
Phát hiện gian lận với Python

Vì sao dùng học máy để phát hiện gian lận?

  1. Mô hình ML thích ứng với dữ liệu, có thể thay đổi theo thời gian
  2. Dùng toàn bộ dữ liệu kết hợp thay vì ngưỡng cho từng đặc trưng
  3. Có thể cho điểm số thay vì có/không
  4. Thường hiệu quả hơn và có thể kết hợp với luật

Phát hiện gian lận với Python

Ôn nhanh về mô hình học máy

from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split
from sklearn import metrics

# Bước 1: tách đặc trưng và nhãn thành dữ liệu train/test X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
# Bước 2: chọn mô hình muốn dùng model = LinearRegression()
# Bước 3: fit mô hình với dữ liệu huấn luyện model.fit(X_train, y_train)
# Bước 4: dự đoán trên dữ liệu kiểm tra y_predicted = model.predict(X_test)
# Bước 5: so sánh y_test với dự đoán và tính chỉ số hiệu năng print (metrics.r2_score(y_test, y_predicted))
0.821206237313
Phát hiện gian lận với Python

Bạn sẽ làm gì trong các chương tới

  • Chương 2. Học có giám sát: huấn luyện mô hình bằng nhãn gian lận sẵn có

  • Chương 3. Học không giám sát: dùng dữ liệu để xác định hành vi “đáng ngờ” không cần nhãn

  • Chương 4. Phát hiện gian lận với dữ liệu văn bản: bổ sung mô hình bằng khai phá văn bản và mô hình chủ đề

Phát hiện gian lận với Python

Ayo berlatih!

Phát hiện gian lận với Python

Preparing Video For Download...