Dự đoán CTR với Machine Learning trong Python
Kevin Huo
Instructor
print(df.hour.head(1))
14102101
df['hour'] = pd.to_datetime(
df['hour'], format = '%y%m%d%H')
df['hour_of_day'] = df['hour'].dt.hour
print(df.hour.head(1))
2014-10-21 01:00:0
print(df.groupby('hour_of_day')
['click'].sum())
click
hour_of_day
1 1092
2 6546
Biến phân loại cần được chuyển sang dạng số
Hàm băm: ánh xạ đầu vào bất kỳ sang số nguyên, luôn cho cùng kết quả với cùng đầu vào
Hàm lambda: lambda x: f(x)
Áp dụng băm với f(x) = hash(x) như sau:
df['site_id'] = df['site_id'].apply(lambda x: hash(x))
83a0ad1a -> -9161053084583616050
85f751fd-> 818242008494177460
count() và nunique():df['ad_type'].count()
50000
df['ad_type'].nunique()
31

Thêm đặc trưng thường tăng sức dự báo
Ví dụ đặc trưng mới: số lần hiển thị theo device_id (người dùng) và search_engine_type:
df['device_id_count'] = df.groupby('device_id')['click'].transform("count")
df['search_engine_type_count'] = df.groupby('search_engine_type')['click'].transform("count")
print(df.head(1))
... device_id_count search_engine_type_count
... 40862 47710
Dự đoán CTR với Machine Learning trong Python