Конструирование признаков

Прогнозирование CTR с помощью машинного обучения на Python

Kevin Huo

Instructor

Работа с датами

print(df.hour.head(1))
14102101
df['hour'] = pd.to_datetime(
  df['hour'], format = '%y%m%d%H')
df['hour_of_day'] = df['hour'].dt.hour
print(df.hour.head(1))
2014-10-21 01:00:0
print(df.groupby('hour_of_day')
      ['click'].sum())
             click
hour_of_day       
1             1092
2             6546
Прогнозирование CTR с помощью машинного обучения на Python

Преобразование категориальных переменных с помощью хэширования

  • Категориальные признаки необходимо преобразовать в числовой формат

  • Хэш-функция: отображает произвольный вход в целое число, возвращая одинаковый результат для одного и того же входа

  • Лямбда-функция: lambda x: f(x)

  • Применение хэш-функции f(x) = hash(x):

df['site_id'] = df['site_id'].apply(lambda x: hash(x))
83a0ad1a -> -9161053084583616050
85f751fd-> 818242008494177460
Прогнозирование CTR с помощью машинного обучения на Python

Подробнее о признаках

  • Примеры count() и nunique():
df['ad_type'].count()
50000
df['ad_type'].nunique()
31

Пример распределения категориального столбца

Прогнозирование CTR с помощью машинного обучения на Python

Создание признаков

  • Большинство переменных — категориальные
  • Больше признаков — выше предсказательная сила

  • Пример нового признака: показы по device_id (пользователь) и search_engine_type:

df['device_id_count'] = df.groupby('device_id')['click'].transform("count")
df['search_engine_type_count'] = df.groupby('search_engine_type')['click'].transform("count")
print(df.head(1))
...  device_id_count  search_engine_type_count
...            40862                     47710
Прогнозирование CTR с помощью машинного обучения на Python

Давайте потренируемся!

Прогнозирование CTR с помощью машинного обучения на Python

Preparing Video For Download...