Rで学ぶ不正検知
Bart Baesens
Professor Data Science at KU Leuven




先頭桁 $D_1$ が $d_1$ となる確率が次の式で近似されるとき、データセットはベンフォードの法則を満たす: $$P(D_1=d_1)=\log(d_1+1)-\log(d_1)=\log\left(1+\frac{1}{d_1}\right) \qquad d_1=1,\ldots,9$$
例
ピンカムはベンフォードの法則がスケーリングに対して不変であることを発見した。
benlaw <- function(d) log10(1 + 1 / d)
benlaw(1)
0.30103

フィボナッチ数の最初の1000個を生成する。
fibnum <- numeric(1000)
fibnum[1] <- fibnum[2] <- 1
for (i in 3:1000) { fibnum[i] <- fibnum[i-1] + fibnum[i-2] }
head(fibnum)
1 1 2 3 5 8
2の冪乗の最初の1000個も生成する。
pow2 <- 2^(1:1000)
head(pow2)
2 4 8 16 32 64
library(benford.analysis)
bfd.fib <- benford(fibnum,
number.of.digits = 1)
plot(bfd.fib)

library(benford.analysis)
bfd.pow2 <- benford(pow2,
number.of.digits = 1)
plot(bfd.pow2)

Rで学ぶ不正検知