특성 표준화

Python으로 Machine Learning을 활용한 CTR 예측

Kevin Huo

Instructor

표준화가 중요한 이유

  • 표준화: 모델의 가정을 충족하도록 데이터 맞추기
  • 일부 특성의 분산이 너무 커서 모델을 지배할 수 있음
  • 예: 한 스팸 사용자 때문에 특정 count 값 범위가 과도하게 큼
  • site_id, app_id, device_id 등 범주형 변수에는 적용하지 않음
Python으로 Machine Learning을 활용한 CTR 예측

로그 정규화

df.var()
click                   1.294270e-01
hour                    1.123316e-01
df.var().median()
0.7108583771671939
print(df['click'].var())
df['device_id_count'] = df[
  'device_id_count'].apply(
  lambda x: np.log(x))
print(df['click'].var())
249362570.10134825
15.628476003312514
Python으로 Machine Learning을 활용한 CTR 예측

데이터 스케일링

  • 표준 스케일링은 모든 특성을 평균 0, 표준편차 1로 변환

표준 스케일링 예시

  • 일반적으로 머신러닝 모델에 유용한 관행
Python으로 Machine Learning을 활용한 CTR 예측

표준 스케일 적용 방법

  • StandardScaler()로 다음과 같이 스케일링합니다:
scaler = StandardScaler()
X[numeric_cols] = scaler.fit_transform(X[numeric_cols])
dtype: float64
1    10.5 -> 0.85
2    32.3 -> 1.54
Python으로 Machine Learning을 활용한 CTR 예측

연습해 봅시다!

Python으로 Machine Learning을 활용한 CTR 예측

Preparing Video For Download...