Pre-elaborazione dei dati

Customer Segmentation in Python

Karolis Urbonas

Head of Data Science, Amazon

Vantaggi del clustering k-means

  • Uno dei metodi più usati di apprendimento non supervisionato
  • Semplice e veloce
  • Funziona bene*

* con alcune assunzioni sui dati

Customer Segmentation in Python

Assunzioni chiave di k-means

  • Distribuzione simmetrica delle variabili (non asimmetriche)
  • Variabili con stessa media
  • Variabili con stessa varianza
Customer Segmentation in Python

Variabili asimmetriche

 

  • Asimmetria a sinistra

 

  • Asimmetria a destra

Customer Segmentation in Python

Variabili asimmetriche

  • Asimmetria rimossa con trasformazione logaritmica

Customer Segmentation in Python

Variabili sulla stessa scala

  • K-means assume media uguale
  • E varianza uguale
  • Non vale per i dati RFM
datamart_rfm.describe()

Customer Segmentation in Python

Ripassiamo i concetti

Customer Segmentation in Python

Preparing Video For Download...