Chuẩn hóa đặc trưng

Dự đoán CTR với Machine Learning trong Python

Kevin Huo

Instructor

Vì sao chuẩn hóa quan trọng

  • Chuẩn hóa: bảo đảm dữ liệu đáp ứng giả định của mô hình
  • Một số đặc trưng có phương sai quá cao, có thể chi phối mô hình
  • Ví dụ: một số đếm có miền giá trị quá lớn do một người dùng spam
  • Không áp dụng cho biến phân loại như site_id, app_id, device_id, v.v.
Dự đoán CTR với Machine Learning trong Python

Chuẩn hóa log

df.var()
click                   1.294270e-01
hour                    1.123316e-01
df.var().median()
0.7108583771671939
print(df['click'].var())
df['device_id_count'] = df[
  'device_id_count'].apply(
  lambda x: np.log(x))
print(df['click'].var())
249362570.10134825
15.628476003312514
Dự đoán CTR với Machine Learning trong Python

Chuẩn hóa dữ liệu

  • Chuẩn hóa chuẩn đặt trung bình = 0 và độ lệch chuẩn = 1 cho mọi đặc trưng

Ví dụ về chuẩn hóa chuẩn

  • Thường là thực hành tốt cho mô hình học máy
Dự đoán CTR với Machine Learning trong Python

Cách chuẩn hóa dữ liệu

  • Có thể chuẩn hóa bằng StandardScaler() như sau:
scaler = StandardScaler()
X[numeric_cols] = scaler.fit_transform(X[numeric_cols])
dtype: float64
1    10.5 -> 0.85
2    32.3 -> 1.54
Dự đoán CTR với Machine Learning trong Python

Ayo berlatih!

Dự đoán CTR với Machine Learning trong Python

Preparing Video For Download...