Kódování kategorických dat pomocí řízeného učení

Feature Engineering v R

Jorge Zazueta

Research Professor and Head of the Modeling Group at the School of Economics, UASLP

Úvod do řízeného kódování

Řízené kódování naproti tomu využívá hodnoty výsledků k odvození číselných příznaků z nominálních prediktorů.

Feature Engineering v R

Úvod do řízeného kódování

Řízené kódování využívá hodnoty výsledků k odvození číselných příznaků z nominálních prediktorů.

Některé funkce řízeného kódování dostupné v balíčku embed

Funkce Definice
step_lencode_glm() Používá věrohodnostní kódování k převodu nominálního prediktoru na sadu skóre odvozených z generalizovaného lineárního modelu.
step_lencode_bayes() Aplikuje bayesovské věrohodnostní kódování k převodu nominálního prediktoru na sadu skóre odvozených z generalizovaného lineárního modelu odhadnutého bayesovskou analýzou.
step_lencode_mixed() Převádí nominální prediktory na sadu skóre odvozených z generalizovaného lineárního smíšeného modelu.
Feature Engineering v R

Předpovídání úspěšnosti žádosti o grant

Chceme předpovědět úspěšnost žádosti o grant pouze na základě kódu sponzora.

lr_model <- logistic_reg() # declare model

lr_recipe_glm <- # Set recipe glm
  recipe(class ~ sponsor_code, 
         data = grants_train) %>%
  step_lencode_glm(sponsor_code, 
                   # Declare outcome variable
                   outcome = vars(class))

lr_workflow_glm <- # Create Workflow
  workflow() %>%
  add_model(lr_model) %>%
  add_recipe(lr_recipe_glm)

Přehled workflow

lr_workflow_glm
-- Workflow ------------------------------------
Preprocessor: Recipe
Model: logistic_reg()

-- Preprocessor --------------------------------
1 Recipe Step

- step_lencode_glm()

-- Model --------------------------------------
Logistic Regression Model Specification (classification)

Computational engine: glm
Feature Engineering v R

Trénování, augmentace a hodnocení

Natrénujeme a vyhodnotíme model

lr_fit_glm <- # Fit
  lr_workflow_glm %>%
  fit(grants_train)

lr_aug_glm <- # Augment
  lr_fit_glm %>%
  augment(grants_test)

glm_model <- lr_aug_glm %>% # Assess
  class_evaluate(truth = class,
                 estimate = .pred_class,
                 .pred_successful)

Výsledky výkonu jsou uloženy v glm_model

glm_model
# A tibble: 2 × 3
  .metric  .estimator .estimate
  <chr>    <chr>          <dbl>
1 accuracy binary         0.728
2 roc_auc  binary         0.684
Feature Engineering v R

Spojení modelů dohromady

Sestavíme bayes_model a mixed_model pro porovnání výkonu příslušných kroků.

# Define model names
model <- c("glm", "glm",
           "bayes","bayes",
           "mixed", "mixed")
# Bind models in a tibble
models <- 
bind_rows(glm_model,
          bayes_model,
          mixed_model)%>%
  add_column(model = model)%>%
  select(-.estimator) %>%
  spread(model,.estimate)

Přehledná tabulka výkonu

models
# A tibble: 2 × 4
  .metric  bayes   glm mixed
  <chr>    <dbl> <dbl> <dbl>
1 accuracy 0.718 0.728 0.720
2 roc_auc  0.686 0.684 0.682
Feature Engineering v R

Vizualizace výsledků

Výsledky vizualizujeme pomocí grafu paralelních souřadnic z balíčku Gally.

# Libraries
library(GGally)

# Parallel coordinates chart
ggparcoord(models,
           columns = 2:4, 
           groupColumn = 1,
           scale="globalminmax",
           showPoints = TRUE)

Graf paralelních souřadnic přesnosti a roc_auc pro všechny modely.

Graf paralelních souřadnic přesnosti a roc_auc pro všechny modely.

Feature Engineering v R

Pojďme si procvičit!

Feature Engineering v R

Preparing Video For Download...