Feature Engineering v R
Jorge Zazueta
Research Professor and Head of the Modeling Group at the School of Economics, UASLP
Řízené kódování naproti tomu využívá hodnoty výsledků k odvození číselných příznaků z nominálních prediktorů.
Řízené kódování využívá hodnoty výsledků k odvození číselných příznaků z nominálních prediktorů.
Některé funkce řízeného kódování dostupné v balíčku embed
| Funkce | Definice |
|---|---|
| step_lencode_glm() | Používá věrohodnostní kódování k převodu nominálního prediktoru na sadu skóre odvozených z generalizovaného lineárního modelu. |
| step_lencode_bayes() | Aplikuje bayesovské věrohodnostní kódování k převodu nominálního prediktoru na sadu skóre odvozených z generalizovaného lineárního modelu odhadnutého bayesovskou analýzou. |
| step_lencode_mixed() | Převádí nominální prediktory na sadu skóre odvozených z generalizovaného lineárního smíšeného modelu. |
Chceme předpovědět úspěšnost žádosti o grant pouze na základě kódu sponzora.
lr_model <- logistic_reg() # declare model
lr_recipe_glm <- # Set recipe glm
recipe(class ~ sponsor_code,
data = grants_train) %>%
step_lencode_glm(sponsor_code,
# Declare outcome variable
outcome = vars(class))
lr_workflow_glm <- # Create Workflow
workflow() %>%
add_model(lr_model) %>%
add_recipe(lr_recipe_glm)
Přehled workflow
lr_workflow_glm
-- Workflow ------------------------------------
Preprocessor: Recipe
Model: logistic_reg()
-- Preprocessor --------------------------------
1 Recipe Step
- step_lencode_glm()
-- Model --------------------------------------
Logistic Regression Model Specification (classification)
Computational engine: glm
Natrénujeme a vyhodnotíme model
lr_fit_glm <- # Fit
lr_workflow_glm %>%
fit(grants_train)
lr_aug_glm <- # Augment
lr_fit_glm %>%
augment(grants_test)
glm_model <- lr_aug_glm %>% # Assess
class_evaluate(truth = class,
estimate = .pred_class,
.pred_successful)
Výsledky výkonu jsou uloženy v glm_model
glm_model
# A tibble: 2 × 3
.metric .estimator .estimate
<chr> <chr> <dbl>
1 accuracy binary 0.728
2 roc_auc binary 0.684
Sestavíme bayes_model a mixed_model pro porovnání výkonu příslušných kroků.
# Define model names
model <- c("glm", "glm",
"bayes","bayes",
"mixed", "mixed")
# Bind models in a tibble
models <-
bind_rows(glm_model,
bayes_model,
mixed_model)%>%
add_column(model = model)%>%
select(-.estimator) %>%
spread(model,.estimate)
Přehledná tabulka výkonu
models
# A tibble: 2 × 4
.metric bayes glm mixed
<chr> <dbl> <dbl> <dbl>
1 accuracy 0.718 0.728 0.720
2 roc_auc 0.686 0.684 0.682
Výsledky vizualizujeme pomocí grafu paralelních souřadnic z balíčku Gally.
# Libraries
library(GGally)
# Parallel coordinates chart
ggparcoord(models,
columns = 2:4,
groupColumn = 1,
scale="globalminmax",
showPoints = TRUE)
Graf paralelních souřadnic přesnosti a roc_auc pro všechny modely.

Feature Engineering v R