Передобробка даних

Сегментація клієнтів у Python

Karolis Urbonas

Head of Data Science, Amazon

Переваги кластеризації k-means

  • Один із найпопулярніших методів без учителя
  • Простий і швидкий
  • Працює добре*

* за певних припущень щодо даних

Сегментація клієнтів у Python

Ключові припущення k-means

  • Симетричний розподіл змінних (без перекосу)
  • Змінні з однаковими середніми
  • Змінні з однаковою дисперсією
Сегментація клієнтів у Python

Зміщені (скошені) змінні

 

  • Лівий перекіс

 

  • Правий перекіс

Сегментація клієнтів у Python

Зміщені (скошені) змінні

  • Перекіс усувають логарифмічним перетворенням

Сегментація клієнтів у Python

Змінні в одній шкалі

  • K-means припускає рівні середні
  • І рівні дисперсії
  • Для даних RFM це не так
datamart_rfm.describe()

Сегментація клієнтів у Python

Повторімо поняття

Сегментація клієнтів у Python

Preparing Video For Download...