R ile Dolandırıcılık Tespiti
Bart Baesens
Professor Data Science at KU Leuven
Tercihen, birden çok mertebeye yayılan 1000'den fazla sayı.
Verinin Benford Yasası'na uymaması her zaman mümkündür.
Bir veri kümesi, ilk iki basamak için Benford Yasası'nı sağlar; yani ilk iki basamak $D_1D_2$'nın $d_1d_2$ olma olasılığı yaklaşık olarak:
$$P(D_1D_2=d_1d_2)=\log\left(1+\frac{1}{d_1d_2}\right) \qquad d_1d_2\in [10, 11, ..., 98, 99]$$
benlaw <- function(d) log10(1 + 1 / d)
benlaw(12)
0.03476211
Bu test, ilk basamak testinden daha güvenilirdir ve sahtekarlık tespitinde en sık kullanılandır.
bfd.cen <- benford(census.2009$pop.2009, number.of.digits = 2)
plot(bfd.cen)

expenses veri kümesi 1000 geri ödeme içerir.benford.analysis paketindeki fonksiyonu yine kullanacağız.bfd1.exp <- benford(expenses, number.of.digits = 1)
plot(bfd1.exp)

bfd2.exp <- benford(expenses, number.of.digits = 2)
plot(bfd2.exp)

R ile Dolandırıcılık Tespiti