R로 시작하는 이상치 탐지 입문
Alastair Rushworth
Data Scientist
plot(Width ~ Height, data = furniture)

이상치는 보통 이웃과 멀리 떨어집니다

library(FNN)
furniture_knn <- get.knn(data = furniture, k = 5)
인자
data: 데이터 행렬k: 이웃 수get.knn() 두 개의 행렬을 반환합니다
names(furniture_knn)
"nn.index" "nn.dist"
거리 행렬
head(furniture_knn$nn.dist, 3)
[,1] [,2] [,3] [,4] [,5]
[1,] 5.128300 5.367791 5.390801 5.740713 8.477025
[2,] 4.300093 5.367791 6.159139 7.091966 7.428176
[3,] 3.047502 3.545978 4.426266 5.006570 5.654202
최근접 이웃까지의 평균 거리
furniture_score <- rowMeans(furniture_knn$nn.dist)
가장 큰 점수는?
which.max(furniture_score)
29
R로 시작하는 이상치 탐지 입문