k-means クラスタリングの限界

Pythonで学ぶクラスタ分析

Shaumik Daityari

Business Analyst

k-means クラスタリングの限界

  • 適切な _K_(クラスタ数)の見つけ方は?
  • 乱数シードの影響
  • 同サイズのクラスタに偏りがち
Pythonで学ぶクラスタ分析

シードの影響

乱数シードを初期化

from numpy import random
random.seed(12)

シード: np.array(1000, 2000)

クラスタサイズ: 29, 29, 43, 47, 52

 

シード: np.array(1,2,3)

クラスタサイズ: 26, 31, 40, 50, 53

Pythonで学ぶクラスタ分析

シードの影響:プロット

シード: np.array(1000, 2000)

シード: np.array(1,2,3)

Pythonで学ぶクラスタ分析

k-means の一様クラスタ

Pythonで学ぶクラスタ分析

k-means の一様クラスタ:比較

3クラスタでの k-means クラスタリング

3クラスタでの階層型クラスタリング

Pythonで学ぶクラスタ分析

まとめ

  • 手法ごとに長所と短所があります
  • アルゴリズム選定前にデータ規模とパターンを考慮
  • クラスタリングは探索的分析の段階です
Pythonで学ぶクラスタ分析

次は演習です

Pythonで学ぶクラスタ分析

Preparing Video For Download...