모델 기반 클러스터링 소개

R로 배우는 Mixture Models

Victor Medina

Researcher at The University of Edinburgh

클러스터링이란?

관측값의 집합을 의미 있는 하위 집합으로 분할하는 절차

 $\to$ 데이터셋의 자연적인 구조를 탐색하고 이해하는 데 도움

R로 배우는 Mixture Models

클러스터링의 응용 분야

  • 의학
    • 예: 의료 영상에서 다양한 조직 유형 구분
  • 비즈니스
    • 예: 타겟 마케팅 프로그램 개발을 위한 고객 그룹 식별
  • 사회 과학
    • 예: 범죄 유형별 도시 구역 구분을 통한 치안 자원 배분
R로 배우는 Mixture Models

클러스터링 방법

  • 분할 기법
    • 관측값 중 클러스터 중심을 찾아 가장 가까운 클러스터에 할당. 예: Kmeans
  • 계층적 기법
    • 유사도를 기반으로 관측값을 연결하여 클러스터 형성. 예: 계층적 클러스터링
  • 모델 기반 방법
    • 확률 분포를 사용하여 클러스터 생성. 예: 혼합 모델
R로 배우는 Mixture Models

성별 데이터셋

gender <- read.csv("gender.csv")
head(gender)
    Height   Weight      BMI
1 73.84702 241.8936 31.18576
2 68.78190 162.3105 24.12104
3 74.11011 212.7409 27.23291
4 71.73098 220.0425 30.06706
5 69.88180 206.3498 29.70803
6 67.25302 152.2122 23.66049
R로 배우는 Mixture Models

성별 데이터셋: 성별을 예측할 수 있습니까?

library(ggplot2)
ggplot(gender, aes(x = Weight, y = BMI)) + geom_points()

R로 배우는 Mixture Models

성별 데이터셋: 성별을 예측할 수 있습니까?

R로 배우는 Mixture Models

전통적인 클러스터링 방법 적용 시

R로 배우는 Mixture Models

모델 기반 클러스터링

R로 배우는 Mixture Models

모델 기반 클러스터링

R로 배우는 Mixture Models

연습해 봅시다!

R로 배우는 Mixture Models

Preparing Video For Download...