Tiền xử lý dữ liệu

Phân khúc khách hàng bằng Python

Karolis Urbonas

Head of Data Science, Amazon

Ưu điểm của phân cụm k-means

  • Một trong các phương pháp học không giám sát phổ biến nhất
  • Đơn giản và nhanh
  • Hoạt động tốt*

* với một số giả định về dữ liệu

Phân khúc khách hàng bằng Python

Giả định chính của k-means

  • Phân phối biến đối xứng (không lệch)
  • Biến có giá trị trung bình giống nhau
  • Biến có phương sai giống nhau
Phân khúc khách hàng bằng Python

Biến bị lệch

 

  • Lệch trái

 

  • Lệch phải

Phân khúc khách hàng bằng Python

Biến bị lệch

  • Khử lệch bằng biến đổi log

Phân khúc khách hàng bằng Python

Đưa biến về cùng thang đo

  • K-means giả định cùng trung bình
  • Và cùng phương sai
  • RFM không thỏa các giả định này
datamart_rfm.describe()

Phân khúc khách hàng bằng Python

Ôn lại khái niệm

Phân khúc khách hàng bằng Python

Preparing Video For Download...