データ前処理

Pythonで学ぶカスタマーセグメンテーション

Karolis Urbonas

Head of Data Science, Amazon

k-means クラスタリングの利点

  • 最も一般的な教師なし学習法の一つ
  • シンプルで高速
  • 条件付きで有効*

* データに関する仮定が必要

Pythonで学ぶカスタマーセグメンテーション

k-means の主要な仮定

  • 変数の分布が対称(非歪)
  • 変数の平均が同程度
  • 変数の分散が同程度
Pythonで学ぶカスタマーセグメンテーション

歪んだ変数

 

  • 左裾(負の歪み)

 

  • 右裾(正の歪み)

Pythonで学ぶカスタマーセグメンテーション

歪んだ変数

  • 対数変換で歪度を除去

Pythonで学ぶカスタマーセグメンテーション

同一スケールの変数

  • k-means は同一の平均を仮定
  • かつ同一の分散を仮定
  • RFM データでは満たされないことが多い
datamart_rfm.describe()

Pythonで学ぶカスタマーセグメンテーション

概念を振り返りましょう

Pythonで学ぶカスタマーセグメンテーション

Preparing Video For Download...