教師あり学習でカテゴリ変数をエンコードする

Rで学ぶ特徴量エンジニアリング

Jorge Zazueta

Research Professor and Head of the Modeling Group at the School of Economics, UASLP

教師ありエンコーディングの導入

対照的に、教師ありエンコーディングは目的変数を用いて名義予測変数から数値特徴量を作成します。

Rで学ぶ特徴量エンジニアリング

教師ありエンコーディングの導入

教師ありエンコーディングは、目的変数を用いて名義予測変数から数値特徴量を作成します。

embed パッケージの主な教師ありエンコーディング関数

Function 定義
step_lencode_glm() 一般化線形モデルに基づく尤度エンコーディングで、名義予測変数を1組のスコアに変換します。
step_lencode_bayes() ベイズ推定で適合した一般化線形モデルに基づくベイズ尤度エンコーディングで、名義予測変数を1組のスコアに変換します。
step_lencode_mixed() 一般化線形混合モデルに基づき、名義予測変数を1組のスコアに変換します。
Rで学ぶ特徴量エンジニアリング

助成金申請の成否を予測する

助成金申請の成否を、スポンサーコードのみから予測します。

lr_model <- logistic_reg() # declare model

lr_recipe_glm <- # Set recipe glm
  recipe(class ~ sponsor_code, 
         data = grants_train) %>%
  step_lencode_glm(sponsor_code, 
                   # Declare outcome variable
                   outcome = vars(class))

lr_workflow_glm <- # Create Workflow
  workflow() %>%
  add_model(lr_model) %>%
  add_recipe(lr_recipe_glm)

ワークフローの概要

lr_workflow_glm
-- Workflow ------------------------------------
Preprocessor: Recipe
Model: logistic_reg()

-- Preprocessor --------------------------------
1 Recipe Step

- step_lencode_glm()

-- Model --------------------------------------
Logistic Regression Model Specification (classification)

Computational engine: glm
Rで学ぶ特徴量エンジニアリング

学習・拡張・評価

モデルを学習し、評価します

lr_fit_glm <- # Fit
  lr_workflow_glm %>%
  fit(grants_train)

lr_aug_glm <- # Augment
  lr_fit_glm %>%
  augment(grants_test)

glm_model <- lr_aug_glm %>% # Assess
  class_evaluate(truth = class,
                 estimate = .pred_class,
                 .pred_successful)

性能結果は glm_model に保存されています。

DNT_CURLY_TAG_3

glm_model


# A tibble: 2 × 3 .metric .estimator .estimate <chr> <chr> <dbl> 1 accuracy binary 0.728 2 roc_auc binary 0.684
Rで学ぶ特徴量エンジニアリング

モデルを結合する

対応する手順の性能を比べるため、bayes_modelmixed_model を作成します。

# Define model names
model <- c("glm", "glm",
           "bayes","bayes",
           "mixed", "mixed")
# Bind models in a tibble
models <- 
bind_rows(glm_model,
          bayes_model,
          mixed_model)%>%
  add_column(model = model)%>%
  select(-.estimator) %>%
  spread(model,.estimate)

便利な性能テーブル

models
# A tibble: 2 × 4
  .metric  bayes   glm mixed
  <chr>    <dbl> <dbl> <dbl>
1 accuracy 0.718 0.728 0.720
2 roc_auc  0.686 0.684 0.682
Rで学ぶ特徴量エンジニアリング

結果の可視化

Gally パッケージで平行座標チャートを作成して可視化します。

# Libraries
library(GGally)

# Parallel coordinates chart
ggparcoord(models,
           columns = 2:4, 
           groupColumn = 1,
           scale="globalminmax",
           showPoints = TRUE)

全モデルの accuracy と roc_auc の平行座標チャート

全モデルの accuracy と roc_auc の平行座標チャート

Rで学ぶ特徴量エンジニアリング

演習に進みましょう!

Rで学ぶ特徴量エンジニアリング

Preparing Video For Download...