R로 배우는 사기 탐지
Bart Baesens
Professor Data Science at KU Leuven
여러 자릿수 범위에 걸쳐 분포한 1000개 이상의 숫자가 이상적입니다.
데이터가 벤포드 법칙을 따르지 않을 수도 있습니다.
데이터셋이 첫 두 자리에 대해 벤포드 법칙을 따르려면, 첫 두 자리 $D_1D_2$가 $d_1d_2$일 확률이 다음과 같아야 합니다:
$$P(D_1D_2=d_1d_2)=\log\left(1+\frac{1}{d_1d_2}\right) \qquad d_1d_2\in [10, 11, ..., 98, 99]$$
benlaw <- function(d) log10(1 + 1 / d)
benlaw(12)
0.03476211
이 검정은 첫 자리 검정보다 신뢰도가 높으며, 사기 탐지에서 가장 많이 활용됩니다.
bfd.cen <- benford(census.2009$pop.2009, number.of.digits = 2)
plot(bfd.cen)

expenses에는 1000건의 청구 내역이 포함되어 있습니다.benford.analysis 패키지의 함수를 다시 사용합니다.bfd1.exp <- benford(expenses, number.of.digits = 1)
plot(bfd1.exp)

bfd2.exp <- benford(expenses, number.of.digits = 2)
plot(bfd2.exp)

R로 배우는 사기 탐지