R로 배우는 사기 탐지
Bart Baesens
Professor Data Science at KU Leuven
head(timestamps)
"20:27:28" "21:08:41" "01:30:16" "00:57:04" "23:12:14" "22:54:16"
library(lubridate) ts <- as.numeric(hms(timestamps)) / 3600head(ts)
20.4577778 21.1447222 1.5044444 0.9511111 23.2038889 22.9044444
library(ggplot2) clock <- ggplot(data.frame(ts), aes(x = ts)) + geom_histogram(breaks = seq(0, 24), colour = "blue", fill = "lightblue") + coord_polar()arithmetic_mean <- mean(ts) clock + geom_vline(xintercept = arithmetic_mean, linetype = 2, color = "red", size = 2)

$$D\sim vonMises\left(\mu,\kappa\right)$$
# 10진수 타임스탬프를 "circular" 클래스로 변환 library(circular) ts <- circular(ts, units = "hours", template = "clock24")head(ts)
Circular Data:
[1] 20.457889 21.144607 1.504422 0.950982 23.203917 4.904397
estimates <- mle.vonmises(ts)
p_mean <- estimates$mu %% 24
concentration <- estimates$kappa

(1) mle.vonmises()로 $S$에 기반해 $\mu(S)$와 $\kappa(S)$ 추정:
estimates <- mle.vonmises(ts)
p_mean <- estimates$mu %% 24
concentration <- estimates$kappa
(2) dvonmises()로 타임스탬프의 밀도(=가능도) 계산:
densities <- dvonmises(ts, mu = p_mean, kappa = concentration)
TRUE, 아니면 FALSEalpha <- 0.90 quantile <- qvonmises(p = (1 - alpha)/2, mu = p_mean, kappa = concentration) %% 24 cutoff <- dvonmises(quantile, mu = p_mean, kappa = concentration)time_feature <- densities >= cutoff


$$
$$

## ts에는 18.42, 20.45, 20.88, 0.75, 19.20, 23.65, 6.08이 포함됨time_feature = c(NA, NA) for (i in 3:length(ts)) { ts_history <- ts[1:(i-1)] ## (1) 이전 타임스탬프estimates <- mle.vonmises(ts_history) ## (2) 과거 타임스탬프로 mu와 kappa 추정 p_mean <- estimates$mu %% 24 concentration <- estimates$kappadens_i <- dvonmises(ts[i], mu = p_mean, kappa = concentration) ## (3) 현재 타임스탬프의 밀도 추정alpha <- 0.90 ## (4) 신뢰수준 90%에서 밀도가 임계값보다 큰지 확인 quantile <- qvonmises((1-alpha)/2, mu=p_mean, kappa=concentration) %% 24 cutoff <- dvonmises(quantile, mu = p_mean, kappa = concentration) time_feature[i] <- dens_i >= cutoff }print(time_feature)
NA NA TRUE FALSE TRUE TRUE FALSE
R로 배우는 사기 탐지