Wstępne przetwarzanie danych

Segmentacja klientów w Pythonie

Karolis Urbonas

Head of Data Science, Amazon

Zalety klasteryzacji k-means

  • Jedna z najpopularniejszych metod uczenia nienadzorowanego
  • Prosta i szybka
  • Działa dobrze*

* przy określonych założeniach dotyczących danych

Segmentacja klientów w Pythonie

Kluczowe założenia k-means

  • Symetryczny rozkład zmiennych (brak skośności)
  • Zmienne o tych samych wartościach średnich
  • Zmienne o tej samej wariancji
Segmentacja klientów w Pythonie

Zmienne skośne

 

  • Lewostronnie skośna

 

  • Prawostronnie skośna

Segmentacja klientów w Pythonie

Zmienne skośne

  • Skośność usunięta za pomocą transformacji logarytmicznej

Segmentacja klientów w Pythonie

Zmienne na tej samej skali

  • K-means zakłada równe średnie
  • Oraz równe wariancje
  • Dane RFM tego nie spełniają
datamart_rfm.describe()

Segmentacja klientów w Pythonie

Powtórzenie pojęć

Segmentacja klientów w Pythonie

Preparing Video For Download...