k-평균 클러스터링의 한계

Python으로 배우는 군집 분석

Shaumik Daityari

Business Analyst

k-평균 클러스터링의 한계

  • 적절한 _K_(클러스터 수)는 어떻게 찾나요?
  • 시드의 영향
  • 동일 크기 클러스터로 치우침
Python으로 배우는 군집 분석

시드의 영향

무작위 시드 초기화

from numpy import random
random.seed(12)

시드: np.array(1000, 2000)

클러스터 크기: 29, 29, 43, 47, 52

 

시드: np.array(1,2,3)

클러스터 크기: 26, 31, 40, 50, 53

Python으로 배우는 군집 분석

시드의 영향: 플롯

시드: np.array(1000, 2000)

시드: np.array(1,2,3)

Python으로 배우는 군집 분석

k-평균의 균일 클러스터

Python으로 배우는 군집 분석

k-평균의 균일 클러스터: 비교

k-평균(3개 클러스터)

계층적 클러스터링(3개 클러스터)

Python으로 배우는 군집 분석

마무리 생각

  • 기법마다 장단점이 있습니다
  • 알고리즘 선택 전, 데이터 크기와 패턴을 고려하십시오
  • 클러스터링은 탐색적 분석 단계입니다
Python으로 배우는 군집 분석

다음: 연습 문제

Python으로 배우는 군집 분석

Preparing Video For Download...