Inżynieria cech w R
Jorge Zazueta
Research Professor and Head of the Modeling Group at the School of Economics, UASLP
Kodowanie nadzorowane, w odróżnieniu od innych metod, wykorzystuje wartości wynikowe do tworzenia cech numerycznych z predyktorów nominalnych.
Kodowanie nadzorowane wykorzystuje wartości wynikowe do tworzenia cech numerycznych z predyktorów nominalnych.
Wybrane funkcje kodowania nadzorowanego dostępne w pakiecie embed
| Funkcja | Opis |
|---|---|
| step_lencode_glm() | Stosuje kodowanie likelihood do konwersji predyktora nominalnego na zestaw wyników z uogólnionego modelu liniowego. |
| step_lencode_bayes() | Stosuje bayesowskie kodowanie likelihood do konwersji predyktora nominalnego na zestaw wyników z uogólnionego modelu liniowego szacowanego metodą bayesowską. |
| step_lencode_mixed() | Konwertuje predyktory nominalne na zestaw wyników z uogólnionego mieszanego modelu liniowego. |
Przewidujemy sukces wniosku grantowego wyłącznie na podstawie kodu sponsora.
lr_model <- logistic_reg() # declare model
lr_recipe_glm <- # Set recipe glm
recipe(class ~ sponsor_code,
data = grants_train) %>%
step_lencode_glm(sponsor_code,
# Declare outcome variable
outcome = vars(class))
lr_workflow_glm <- # Create Workflow
workflow() %>%
add_model(lr_model) %>%
add_recipe(lr_recipe_glm)
Podsumowanie przepływu pracy
lr_workflow_glm
-- Workflow ------------------------------------
Preprocessor: Recipe
Model: logistic_reg()
-- Preprocessor --------------------------------
1 Recipe Step
- step_lencode_glm()
-- Model --------------------------------------
Logistic Regression Model Specification (classification)
Computational engine: glm
Dopasowujemy i oceniamy model
lr_fit_glm <- # Fit
lr_workflow_glm %>%
fit(grants_train)
lr_aug_glm <- # Augment
lr_fit_glm %>%
augment(grants_test)
glm_model <- lr_aug_glm %>% # Assess
class_evaluate(truth = class,
estimate = .pred_class,
.pred_successful)
Wyniki wydajności są przechowywane w glm_model
glm_model
# A tibble: 2 × 3
.metric .estimator .estimate
<chr> <chr> <dbl>
1 accuracy binary 0.728
2 roc_auc binary 0.684
Budujemy bayes_model i mixed_model, aby porównać wydajność odpowiednich kroków.
# Define model names
model <- c("glm", "glm",
"bayes","bayes",
"mixed", "mixed")
# Bind models in a tibble
models <-
bind_rows(glm_model,
bayes_model,
mixed_model)%>%
add_column(model = model)%>%
select(-.estimator) %>%
spread(model,.estimate)
Wygodna tabela wyników
models
# A tibble: 2 × 4
.metric bayes glm mixed
<chr> <dbl> <dbl> <dbl>
1 accuracy 0.718 0.728 0.720
2 roc_auc 0.686 0.684 0.682
Wyniki wizualizujemy na wykresie współrzędnych równoległych z pakietu Gally.
# Libraries
library(GGally)
# Parallel coordinates chart
ggparcoord(models,
columns = 2:4,
groupColumn = 1,
scale="globalminmax",
showPoints = TRUE)
Wykres współrzędnych równoległych dla accuracy i roc_auc – porównanie wszystkich modeli.

Inżynieria cech w R