Tăng mẫu tổng hợp

Phát hiện gian lận với R

Sebastiaan Höppner

PhD researcher in Data Science at KU Leuven

Tăng mẫu với 'SMOTE'

  • SMOTE: Synthetic Minority Oversampling TEchnique (Chawla et al., 2002)
  • Tăng mẫu lớp thiểu số (= gian lận) bằng cách tạo các trường hợp tổng hợp
Phát hiện gian lận với R
dim(transfer_data)
1000    4
head(transfer_data)
  isFraud    amount   balance     ratio
1   false  528.6840 1529.4732 0.3456641
2   false  184.0193  836.3509 0.2200265
3   false 1885.8024 2984.0684 0.6319568
4   false  732.0286 1248.7217 0.5862224
prop.table(table(transfer_data$isFraud))
 false  true
  0.99  0.01
Phát hiện gian lận với R

smote_scatterplot_1

Phát hiện gian lận với R

smote_scatterplot_2

Phát hiện gian lận với R

SMOTE

Chọn một trường hợp gian lận X (Tim)

smote_zoomin

Phát hiện gian lận với R

SMOTE - bước 1

Bước 1

Tìm K láng giềng gần nhất gian lận của X (Tim)

ví dụ: K = 4

smote_step1

Phát hiện gian lận với R

SMOTE - bước 2

Bước 2

Ngẫu nhiên chọn một láng giềng gần nhất của Tim

ví dụ: X4 (Bart)

smote_step2

Phát hiện gian lận với R

SMOTE - bước 3

Bước 3: tạo mẫu tổng hợp

synthetic_case_1

Phát hiện gian lận với R

SMOTE - bước 3

Bước 3: tạo mẫu tổng hợp

synthetic_case_2

Phát hiện gian lận với R

SMOTE - bước 3

Bước 3: tạo mẫu tổng hợp

synthetic_case_3

Phát hiện gian lận với R

SMOTE - bước 3

smote_step3

Phát hiện gian lận với R

SMOTE - bước 4

Bước 4

Lặp lại bước 1–3 cho mỗi trường hợp gian lận dup_size lần

ví dụ: dup_size = 10

smote_step3

Phát hiện gian lận với R
library(smotefamily)
smote_output = SMOTE(X = transfer_data[, -1],
                       target = transfer_data$isFraud,
                       K = 4,
                       dup_size = 10)

oversampled_data = smote_output$data
table(oversampled_data$isFraud)
false  true
  990   110
prop.table(table(oversampled_data$isFraud))
false  true
  0.9   0.1
Phát hiện gian lận với R

smote_result

Phát hiện gian lận với R

Ayo berlatih!

Phát hiện gian lận với R

Preparing Video For Download...