Предобработка данных

Сегментация клиентов в Python

Karolis Urbonas

Head of Data Science, Amazon

Преимущества кластеризации k-means

  • Один из наиболее популярных методов обучения без учителя
  • Простой и быстрый
  • Хорошо работает*

* при определённых допущениях о данных

Сегментация клиентов в Python

Ключевые допущения k-means

  • Симметричное распределение переменных (без скоса)
  • Одинаковые средние значения переменных
  • Одинаковая дисперсия переменных
Сегментация клиентов в Python

Переменные со скосом

 

  • Скос влево

 

  • Скос вправо

Сегментация клиентов в Python

Переменные со скосом

  • Скос устраняется логарифмическим преобразованием

Сегментация клиентов в Python

Переменные в одном масштабе

  • K-means предполагает равные средние
  • И равную дисперсию
  • В данных RFM это условие не выполняется
datamart_rfm.describe()

Сегментация клиентов в Python

Давайте повторим пройденное

Сегментация клиентов в Python

Preparing Video For Download...