Навіщо трансформувати наявні ознаки?

Feature Engineering в R

Jorge Zazueta

Research Professor. Head of the Modeling Group at the School of Economics, UASLP

Полегшуємо роботу моделі

Можна підвищити якість моделі машинного навчання, зробивши дані зручнішими для обробки.

glimpse(loans_num)
Rows: 614
Columns: 6
$ Loan_Status       <fct> Y, N, Y, Y, Y, Y, Y, N, Y, N, Y, Y, Y, N...
$ ApplicantIncome   <dbl> 5849, 4583, 3000, 2583, 6000, 5417, 233...
$ CoapplicantIncome <dbl> 0, 1508, 0, 2358, 0, 4196, 1516, 2504, 1...
$ LoanAmount        <dbl> NA, 128, 66, 120, 141, 267, 95, 158, 168...
$ Loan_Amount_Term  <dbl> 360, 360, 360, 360, 360, 360, 360, 360, ...
$ Credit_History    <fct> 1, 1, 1, 1, 1, 1, 1, 0, 1, 1, 1, 1, 1, 1...
Feature Engineering в R

Log-трансформація

Застосуйте log-трансформацію до числових ознак, щоб:

  • Усунути перекіс розподілу
  • Зменшити вплив викидів
  • Перетворити мультиплікативні зв'язки на адитивні
  • Зробити дані придатнішими для моделювання
  • Працює лише для додатних значень

Дані суми кредиту після log-трансформації

Графічне порівняння сирих і log-трансформованих даних

Feature Engineering в R

Нормалізація

Нормалізуйте або масштабуйте числові ознаки, щоб:

  • Жодна ознака не домінувала над іншими
  • Полегшити інтерпретацію завдяки порівнюваним масштабам
  • Зробити дані придатнішими для моделювання

наприклад, значення терміну кредиту сильно різняться

Гістограма значень терміну кредиту.

Feature Engineering в R

Нормалізація

Нормалізуйте або масштабуйте числові ознаки, щоб:

  • Жодна ознака не домінувала над іншими
  • Краще працювати з викидами та
  • Пропущеними даними
  • Зробити дані придатнішими для моделювання

Нормалізовані значення зберігають розподіл, але мають варіацію.

Гістограма значень суми кредиту з накладеною нормалізованою кривою.

Feature Engineering в R

Визначення моделі та recipe

Тепер можна оголосити модель логістичної регресії та додати recipe для імпутації, нормалізації й log-трансформації потрібних ознак.

lr_model <- logistic_reg()

lr_recipe <- 
  recipe(Loan_Status ~., 
         data = train) %>%
  step_impute_knn(
    all_numeric_predictors())%>%
  step_normalize(Loan_Amount_Term) %>%
  step_log(all_numeric_predictors(),
           -Loan_Amount_Term, offset = 1)

Друк об'єкта recipe показує підсумок застосованих кроків.

lr_recipe
Recipe

Inputs:

      role #variables
   outcome          1
 predictor          5

Operations:

K-nearest neighbor imputation for all_numeric_predictors()
Centering and scaling for Loan_Amount_Term
Log transformation on all_numeric_predictors(),-Loan_Amount_Term
Feature Engineering в R

Ефективне вимірювання якості

Ми задаємо набір метрик roc_auc, accuracy і sens для оцінювання об'єкта робочого процесу підгонки lr_fit.

class_evaluate <- metric_set(
  roc_auc, accuracy, sens)

І запустіть його, як будь-яку функцію.

lr_aug %>% 
  class_evaluate(
    truth = Loan_Status, 
    estimate = .pred_class, 
    .pred_Y)

Набір метрик на замовлення

# A tibble: 3 × 3
  .metric  .estimator .estimate
  <chr>    <chr>          <dbl>
1 accuracy binary         0.813
2 sens     binary         0.467
3 roc_auc  binary         0.288
Feature Engineering в R

Давайте потренуємось!

Feature Engineering в R

Preparing Video For Download...