Phát hiện gian lận với Python
Charlotte Werger
Data Scientist

Hệ thống dựa trên luật có hạn chế:

from sklearn.linear_model import LinearRegression from sklearn.model_selection import train_test_split from sklearn import metrics# Bước 1: tách đặc trưng và nhãn thành dữ liệu train/test X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)# Bước 2: chọn mô hình muốn dùng model = LinearRegression()# Bước 3: fit mô hình với dữ liệu huấn luyện model.fit(X_train, y_train)# Bước 4: dự đoán trên dữ liệu kiểm tra y_predicted = model.predict(X_test)# Bước 5: so sánh y_test với dự đoán và tính chỉ số hiệu năng print (metrics.r2_score(y_test, y_predicted))
0.821206237313
Chương 2. Học có giám sát: huấn luyện mô hình bằng nhãn gian lận sẵn có
Chương 3. Học không giám sát: dùng dữ liệu để xác định hành vi “đáng ngờ” không cần nhãn
Chương 4. Phát hiện gian lận với dữ liệu văn bản: bổ sung mô hình bằng khai phá văn bản và mô hình chủ đề

Phát hiện gian lận với Python