Rで学ぶ不正検知
Tim Verdonck
Professor Data Science at KU Leuven
外れ値は、大多数のパターンから外れる観測です。
外れ値は不正の警告となることがあります。
外れ値検出の一般的手法:
観測 $x_i$ のzスコア $z_i$:
$$z_i=\frac{x_i-\hat{\mu}}{\hat{\sigma}} = \frac{x_i-\overline{x}}{s}$$
データセット loginc は10人の月収を対数変換したものです:
loginc: 7.876 7.681 7.628 ... 7.764 9.912 # ← 最後は明らかな外れ値!
Mean <- mean(loginc)
Sd <- sd(loginc)
zscore <- (loginc - Mean) / Sd
abs(zscore) > 3
FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE
標本平均: $$\overline{x}=\frac{1}{n}\sum_i x_i$$
mean(loginc)mean(loginc9)
7.9864477.772392
loginc9 は loginc から外れ値のみを除いたものです。
$n$ 個の観測を小さい順に並べ、標本中央値 $Med(X_n)$ は、$n$ が奇数なら $(n+1)/2$ 番目、偶数なら $n/2$ 番目と $n/2+1$ 番目の平均です。
median(loginc)
7.816658
median(loginc9)
7.764296
(1) 標本標準偏差: $$s= \sqrt{\frac{1}{n-1}\sum_i (x_i-\hat{\mu})^2}$$
sd(loginc)
0.6976615
sd(loginc9)
0.1791729
(2) 中央絶対偏差 (MAD): $$Mad(X_n)=1.4826Med(|x_i-Med(X_n)|)$$
(3) 四分位範囲 (正規化): $$IQR(X_n)= IQR = 0.7413(Q_3-Q_1)$$ ここで $Q_1$, $Q_3$ は第1・第3四分位数
IQR(loginc)/1.349
0.2056784
mad(loginc)
0.2396159
mad(loginc9)
0.201305
IQR(loginc9)/1.349
0.1839295
ロバスト推定量でロバストzスコアを計算:
$$z_i=\frac{x_i-\hat{\mu}}{\hat{\sigma}} =\frac{x_i-Med(X_n)}{Mad(X_n)}$$
robzscore <- (loginc - median(loginc)) / mad(loginc)abs(robzscore) > 3 ## 外れ値の判定
FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE FALSE TRUE
robzscore[10] ## 外れ値のロバストzスコア
8.748523

boxplot(los, col = "blue", ylab = "Lenght of Stay (LOS)")$out
59 33 42 67 35 47 102 36 27 31 27 30 29 32 37 27 38


調整箱ひげ図での外れ値:
library(robustbase)
adjbox(los)$out
59 67 102
調整箱ひげ図の統計量:
adjboxStats(los)$stats
2 4 8 13 47


Rで学ぶ不正検知