カテゴリカル入力

R による Supervised Learning:回帰

Nina Zumel and John Mount

Win-Vector, LLC

例:食事が体重減少に与える影響

WtLoss24 ~ Diet + Age + BMI
Diet Age BMI WtLoss24
Med 59 30.67 -6.7
Low-Carb 48 29.59 8.4
Low-Fat 52 32.9 6.3
Med 53 28.92 8.3
Low-Fat 47 30.20 6.3
R による Supervised Learning:回帰

model.matrix()

model.matrix(WtLoss24 ~ Diet + Age + BMI, data = diet)
  • すべて数値
  • N水準のカテゴリカル変数をN-1個のダミー変数に変換
R による Supervised Learning:回帰

カテゴリを表すダミー変数

元データ

Diet Age ...
Med 59 ...
Low-Carb 48 ...
Low-Fat 52 ...
Med 53 ...
Low-Fat 47 ...

モデル行列

(Int) DietLow-Fat DietMed ...
1 0 1 ...
1 0 0 ...
1 1 0 ...
1 0 1 ...
1 1 0 ...
  • 参照水準:"Low-Carb"
R による Supervised Learning:回帰

ダミー変数の解釈

線形モデル:

$$ WtLoss24 = \beta_{0} + \beta_{DietLow} x_{DietLow} + \beta_{DietMed} x_{DietMed} + \beta_{Age} x_{Age} + \beta_{BMI} x_{BMI} $$

lm(WtLoss24 ~ Diet + Age + BMI, data = diet))
Coefficients:
      (Intercept)        DietLow-Fat     DietMed  
         -1.37149           -2.32130    -0.97883  
              Age                BMI  
          0.12648            0.01262
R による Supervised Learning:回帰

ワンホットエンコーディングの問題点

  • 水準数が多すぎると問題になる
    • 例:郵便番号(約40,000件)
  • 幾何学的手法でハッシュ化しないこと!
R による Supervised Learning:回帰

練習しましょう!

R による Supervised Learning:回帰

Preparing Video For Download...