One-Hot-Encoding av kategoriska variabler

Övervakad inlärning i R: Regression

Nina Zumel and John Mount

Win-Vector, LLC

Varför konvertera kategoriska variabler manuellt?

  • De flesta R-funktioner hanterar konverteringen åt dig
    • model.matrix()
  • xgboost() gör det inte
    • Kategoriska variabler måste konverteras till numerisk representation
  • Konvertering till indikatorer: one-hot encoding
Övervakad inlärning i R: Regression

One-hot-encoding och datarensning med `vtreat`

Grundidé:

  • designTreatmentsZ() för att skapa en behandlingsplan från träningsdata, sedan
  • prepare() för att skapa "ren" data
    • helt numerisk
    • inga saknade värden
      • använd prepare() med behandlingsplanen för all framtida data
Övervakad inlärning i R: Regression

Ett litet vtreat-exempel

Träningsdata

x u y
one 44 0.4855671
two 24 1.3683726
three 66 2.0352837
two 22 1.6396267

Testdata

x u y
one 5 2.6488148
three 12 1.5012938
one 56 0.1993731
two 28 1.2778516
Övervakad inlärning i R: Regression

Skapa behandlingsplanen

vars <- c("x", "u")
treatplan <- designTreatmentsZ(dframe, varslist, verbose = FALSE)

Indata till designTreatmentsZ()

  • dframe: träningsdata
  • varlist: lista med namn på indatavariabler
  • ange verbose = FALSE för att dölja förloppsmeddela nden
Övervakad inlärning i R: Regression

Hämta de nya variablerna

scoreFrame beskriver variabelmappning och typer

(scoreFrame <- treatplan$scoreFrame %>% 
     select(varName, origName, code))
        varName origName  code
1   x_lev_x.one        x   lev
2 x_lev_x.three        x   lev
3   x_lev_x.two        x   lev
4        x_catP        x  catP
5       u_clean        u clean

Hämta namnen på de nya lev- och clean-variablerna

(newvars <- scoreFrame %>% 
     filter(code %in% c("clean", "lev")) %>%
     use_series(varName))
"x_lev_x.one"   "x_lev_x.three" "x_lev_x.two"   "u_clean"
Övervakad inlärning i R: Regression

Förbered träningsdata för modellering

training.treat <- prepare(treatmentplan, dframe, varRestriction = newvars)

Indata till prepare():

  • treatmentplan: behandlingsplan
  • dframe: dataram
  • varRestriction: lista med variabler att förbereda (valfritt)
    • standard: förbereder alla variabler
Övervakad inlärning i R: Regression

Data före och efter behandling

Träningsdata

x u y
one 44 0.4855671
two 24 1.3683726
three 66 2.0352837
two 22 1.6396267

Behandlad träningsdata

x_lev _x. one x_lev _x. three x_lev _x. two u_clean
1 0 0 44
0 0 1 24
0 1 0 66
0 0 1 22
Övervakad inlärning i R: Regression

Förbered testdata innan modellen tillämpas

(test.treat <- prepare(treatplan, test, varRestriction = newvars))
  x_lev_x.one x_lev_x.three x_lev_x.two u_clean
1           1             0           0       5
2           0             1           0      12
3           1             0           0      56
4           0             0           1      28
Övervakad inlärning i R: Regression

vtreat-behandling är robust

Tidigare osedd x-nivå: four

x u y
one 4 0.2331301
two 14 1.9331760
three 66 3.1251029
four 25 4.0332491

four kodas till (0, 0, 0)

prepare(treatplan, toomany, ...)
x_lev _x. one x_lev _x. three x_lev _x. two u_clean
1 0 0 4
0 0 1 14
0 1 0 66
0 0 0 25
Övervakad inlärning i R: Regression

Nu kör vi en övning!

Övervakad inlärning i R: Regression

Preparing Video For Download...