Конструирование признаков в R
Jorge Zazueta
Research Professor and Head of the Modeling Group at the School of Economics, UASLP
Кодирование с учителем использует значения целевой переменной для получения числовых признаков из номинальных предикторов.
Кодирование с учителем использует значения целевой переменной для получения числовых признаков из номинальных предикторов.
Некоторые функции кодирования с учителем из пакета embed
| Функция | Описание |
|---|---|
| step_lencode_glm() | Применяет кодирование правдоподобием для преобразования номинального предиктора в набор оценок на основе обобщённой линейной модели. |
| step_lencode_bayes() | Применяет байесовское кодирование правдоподобием для преобразования номинального предиктора в набор оценок на основе обобщённой линейной модели, оцениваемой байесовским методом. |
| step_lencode_mixed() | Преобразует номинальные предикторы в набор оценок на основе обобщённой линейной смешанной модели. |
Задача — предсказать успех заявки на грант только на основе кода спонсора.
lr_model <- logistic_reg() # declare model
lr_recipe_glm <- # Set recipe glm
recipe(class ~ sponsor_code,
data = grants_train) %>%
step_lencode_glm(sponsor_code,
# Declare outcome variable
outcome = vars(class))
lr_workflow_glm <- # Create Workflow
workflow() %>%
add_model(lr_model) %>%
add_recipe(lr_recipe_glm)
Сводка рабочего процесса
lr_workflow_glm
-- Workflow ------------------------------------
Preprocessor: Recipe
Model: logistic_reg()
-- Preprocessor --------------------------------
1 Recipe Step
- step_lencode_glm()
-- Model --------------------------------------
Logistic Regression Model Specification (classification)
Computational engine: glm
Обучаем модель и оцениваем её качество
lr_fit_glm <- # Fit
lr_workflow_glm %>%
fit(grants_train)
lr_aug_glm <- # Augment
lr_fit_glm %>%
augment(grants_test)
glm_model <- lr_aug_glm %>% # Assess
class_evaluate(truth = class,
estimate = .pred_class,
.pred_successful)
Результаты сохранены в glm_model
glm_model
# A tibble: 2 × 3
.metric .estimator .estimate
<chr> <chr> <dbl>
1 accuracy binary 0.728
2 roc_auc binary 0.684
Строим bayes_model и mixed_model, чтобы сравнить качество соответствующих методов.
# Define model names
model <- c("glm", "glm",
"bayes","bayes",
"mixed", "mixed")
# Bind models in a tibble
models <-
bind_rows(glm_model,
bayes_model,
mixed_model)%>%
add_column(model = model)%>%
select(-.estimator) %>%
spread(model,.estimate)
Удобная таблица результатов
models
# A tibble: 2 × 4
.metric bayes glm mixed
<chr> <dbl> <dbl> <dbl>
1 accuracy 0.718 0.728 0.720
2 roc_auc 0.686 0.684 0.682
Визуализируем результаты на диаграмме параллельных координат из пакета Gally.
# Libraries
library(GGally)
# Parallel coordinates chart
ggparcoord(models,
columns = 2:4,
groupColumn = 1,
scale="globalminmax",
showPoints = TRUE)
Диаграмма параллельных координат для accuracy и roc_auc по всем моделям.

Конструирование признаков в R