One-Hot-Encoding zmiennych kategorycznych

Nadzorowane uczenie maszynowe w R: regresja

Nina Zumel and John Mount

Win-Vector, LLC

Dlaczego ręcznie konwertować zmienne kategoryczne?

  • Większość funkcji R automatycznie obsługuje konwersję
    • model.matrix()
  • xgboost() nie obsługuje
    • Należy ręcznie przekonwertować zmienne kategoryczne na liczby
  • Konwersja na wskaźniki: one-hot encoding
Nadzorowane uczenie maszynowe w R: regresja

One-hot-encoding i czyszczenie danych z `vtreat`

Podstawowa idea:

  • designTreatmentsZ() – opracowanie planu leczenia na danych treningowych, następnie
  • prepare() – tworzenie „czystych" danych
    • wyłącznie numeryczne
    • brak brakujących wartości
      • używaj prepare() z planem leczenia dla wszystkich przyszłych danych
Nadzorowane uczenie maszynowe w R: regresja

Prosty przykład vtreat

Dane treningowe

x u y
one 44 0.4855671
two 24 1.3683726
three 66 2.0352837
two 22 1.6396267

Dane testowe

x u y
one 5 2.6488148
three 12 1.5012938
one 56 0.1993731
two 28 1.2778516
Nadzorowane uczenie maszynowe w R: regresja

Tworzenie planu leczenia

vars <- c("x", "u")
treatplan <- designTreatmentsZ(dframe, varslist, verbose = FALSE)

Argumenty designTreatmentsZ()

  • dframe: dane treningowe
  • varlist: lista nazw zmiennych wejściowych
  • ustaw verbose = FALSE, aby ukryć komunikaty o postępie
Nadzorowane uczenie maszynowe w R: regresja

Pobierz nowe zmienne

scoreFrame opisuje mapowanie zmiennych i typy

(scoreFrame <- treatplan$scoreFrame %>% 
     select(varName, origName, code))
        varName origName  code
1   x_lev_x.one        x   lev
2 x_lev_x.three        x   lev
3   x_lev_x.two        x   lev
4        x_catP        x  catP
5       u_clean        u clean

Pobierz nazwy nowych zmiennych lev i clean

(newvars <- scoreFrame %>% 
     filter(code %in% c("clean", "lev")) %>%
     use_series(varName))
"x_lev_x.one"   "x_lev_x.three" "x_lev_x.two"   "u_clean"
Nadzorowane uczenie maszynowe w R: regresja

Przygotowanie danych treningowych do modelowania

training.treat <- prepare(treatmentplan, dframe, varRestriction = newvars)

Argumenty prepare():

  • treatmentplan: plan leczenia
  • dframe: ramka danych
  • varRestriction: lista zmiennych do przygotowania (opcjonalne)
    • domyślnie: przygotuj wszystkie zmienne
Nadzorowane uczenie maszynowe w R: regresja

Dane przed i po przetworzeniu

Dane treningowe

x u y
one 44 0.4855671
two 24 1.3683726
three 66 2.0352837
two 22 1.6396267

Przetworzone dane treningowe

x_lev _x. one x_lev _x. three x_lev _x. two u_clean
1 0 0 44
0 0 1 24
0 1 0 66
0 0 1 22
Nadzorowane uczenie maszynowe w R: regresja

Przygotowanie danych testowych przed zastosowaniem modelu

(test.treat <- prepare(treatplan, test, varRestriction = newvars))
  x_lev_x.one x_lev_x.three x_lev_x.two u_clean
1           1             0           0       5
2           0             1           0      12
3           1             0           0      56
4           0             0           1      28
Nadzorowane uczenie maszynowe w R: regresja

Przetwarzanie vtreat jest odporne

Nieznany wcześniej poziom x: four

x u y
one 4 0.2331301
two 14 1.9331760
three 66 3.1251029
four 25 4.0332491

four koduje się jako (0, 0, 0)

prepare(treatplan, toomany, ...)
x_lev _x. one x_lev _x. three x_lev _x. two u_clean
1 0 0 4
0 0 1 14
0 1 0 66
0 0 0 25
Nadzorowane uczenie maszynowe w R: regresja

Czas na ćwiczenia!

Nadzorowane uczenie maszynowe w R: regresja

Preparing Video For Download...