Kodowanie danych kategorycznych z użyciem uczenia nadzorowanego

Inżynieria cech w R

Jorge Zazueta

Research Professor and Head of the Modeling Group at the School of Economics, UASLP

Wprowadzenie do kodowania nadzorowanego

Kodowanie nadzorowane, w odróżnieniu od innych metod, wykorzystuje wartości wynikowe do tworzenia cech numerycznych z predyktorów nominalnych.

Inżynieria cech w R

Wprowadzenie do kodowania nadzorowanego

Kodowanie nadzorowane wykorzystuje wartości wynikowe do tworzenia cech numerycznych z predyktorów nominalnych.

Wybrane funkcje kodowania nadzorowanego dostępne w pakiecie embed

Funkcja Opis
step_lencode_glm() Stosuje kodowanie likelihood do konwersji predyktora nominalnego na zestaw wyników z uogólnionego modelu liniowego.
step_lencode_bayes() Stosuje bayesowskie kodowanie likelihood do konwersji predyktora nominalnego na zestaw wyników z uogólnionego modelu liniowego szacowanego metodą bayesowską.
step_lencode_mixed() Konwertuje predyktory nominalne na zestaw wyników z uogólnionego mieszanego modelu liniowego.
Inżynieria cech w R

Przewidywanie sukcesu wniosku grantowego

Przewidujemy sukces wniosku grantowego wyłącznie na podstawie kodu sponsora.

lr_model <- logistic_reg() # declare model

lr_recipe_glm <- # Set recipe glm
  recipe(class ~ sponsor_code, 
         data = grants_train) %>%
  step_lencode_glm(sponsor_code, 
                   # Declare outcome variable
                   outcome = vars(class))

lr_workflow_glm <- # Create Workflow
  workflow() %>%
  add_model(lr_model) %>%
  add_recipe(lr_recipe_glm)

Podsumowanie przepływu pracy

lr_workflow_glm
-- Workflow ------------------------------------
Preprocessor: Recipe
Model: logistic_reg()

-- Preprocessor --------------------------------
1 Recipe Step

- step_lencode_glm()

-- Model --------------------------------------
Logistic Regression Model Specification (classification)

Computational engine: glm
Inżynieria cech w R

Dopasowanie, augmentacja i ocena

Dopasowujemy i oceniamy model

lr_fit_glm <- # Fit
  lr_workflow_glm %>%
  fit(grants_train)

lr_aug_glm <- # Augment
  lr_fit_glm %>%
  augment(grants_test)

glm_model <- lr_aug_glm %>% # Assess
  class_evaluate(truth = class,
                 estimate = .pred_class,
                 .pred_successful)

Wyniki wydajności są przechowywane w glm_model

glm_model
# A tibble: 2 × 3
  .metric  .estimator .estimate
  <chr>    <chr>          <dbl>
1 accuracy binary         0.728
2 roc_auc  binary         0.684
Inżynieria cech w R

Łączenie modeli

Budujemy bayes_model i mixed_model, aby porównać wydajność odpowiednich kroków.

# Define model names
model <- c("glm", "glm",
           "bayes","bayes",
           "mixed", "mixed")
# Bind models in a tibble
models <- 
bind_rows(glm_model,
          bayes_model,
          mixed_model)%>%
  add_column(model = model)%>%
  select(-.estimator) %>%
  spread(model,.estimate)

Wygodna tabela wyników

models
# A tibble: 2 × 4
  .metric  bayes   glm mixed
  <chr>    <dbl> <dbl> <dbl>
1 accuracy 0.718 0.728 0.720
2 roc_auc  0.686 0.684 0.682
Inżynieria cech w R

Wizualizacja wyników

Wyniki wizualizujemy na wykresie współrzędnych równoległych z pakietu Gally.

# Libraries
library(GGally)

# Parallel coordinates chart
ggparcoord(models,
           columns = 2:4, 
           groupColumn = 1,
           scale="globalminmax",
           showPoints = TRUE)

Wykres współrzędnych równoległych dla accuracy i roc_auc – porównanie wszystkich modeli.

Wykres współrzędnych równoległych dla accuracy i roc_auc – porównanie wszystkich modeli.

Inżynieria cech w R

Czas na ćwiczenia!

Inżynieria cech w R

Preparing Video For Download...