데이터 전처리

Python을 활용한 고객 세분화

Karolis Urbonas

Head of Data Science, Amazon

K-평균 군집화의 장점

  • 가장 대중적인 비지도학습 방법 중 하나
  • 단순하고 빠름
  • 잘 동작함*

* 데이터에 대한 몇 가지 가정 하에서

Python을 활용한 고객 세분화

K-평균의 핵심 가정

  • 변수 분포가 대칭(비왜도)
  • 변수의 평균이 동일
  • 변수의 분산이 동일
Python을 활용한 고객 세분화

왜도 있는 변수

 

  • 좌측 왜도

 

  • 우측 왜도

Python을 활용한 고객 세분화

왜도 있는 변수

  • 로그 변환으로 왜도 제거

Python을 활용한 고객 세분화

동일 스케일의 변수

  • K-평균은 평균이 같다고 가정
  • 분산도 같다고 가정
  • RFM 데이터에는 해당 없음
datamart_rfm.describe()

Python을 활용한 고객 세분화

개념 정리

Python을 활용한 고객 세분화

Preparing Video For Download...