R에서 tidymodels로 모델링하기
David Svancer
Data Scientist
특성이나 집단을 부호화한 데이터
예시
회사 내 부서
모국어
자동차 유형
모델링을 위해 명목형 데이터를 수치형으로 변환해야 합니다 원-핫 인코딩
더미 변수 인코딩
recipes 패키지의 기본값
명목형 예측 변수 - lead_source와 us_location
leads_training
# A tibble: 996 x 7
purchased total_visits total_time pages_per_visit total_clicks lead_source us_location
<fct> <dbl> <dbl> <dbl> <dbl> <fct> <fct>
1 yes 7 1148 7 59 direct_traffic west
2 no 5 228 2.5 25 email southeast
3 no 7 481 2.33 21 organic_search west
4 no 4 177 4 37 direct_traffic west
5 no 2 1273 2 26 email midwest
# ... with 991 more rows
step_dummy() 함수
recipe(purchased ~ ., data = leads_training) %>%step_dummy(lead_source, us_location) %>%prep(training = leads_training) %>%bake(new_data = leads_test)
# A tibble: 332 x 12
total_visits ... lead_source_email lead_source_organic_search lead_source_direct_traffic us_location_southeast ... us_location_west
<dbl> ... <dbl> <dbl> <dbl> <dbl> <dbl>
1 8 ... 0 0 1 0 1
2 4 ... 0 0 1 0 0
3 3 ... 0 1 0 0 1
4 2 ... 1 0 0 0 0
5 9 ... 0 0 1 0 1
# ... with 327 more rows
all_nominal() 및 all_outcomes() 선택자를 사용한 열 유형 선택
-all_outcomes()는 명목형 종속 변수 purchased를 제외합니다recipe(purchased ~ ., data = leads_training) %>%step_dummy(all_nominal(), -all_outcomes()) %>%prep(training = leads_training) %>%bake(new_data = leads_test)
# A tibble: 332 x 12
total_visits ... lead_source_email lead_source_organic_search lead_source_direct_traffic ... us_location_west
<dbl> ... <dbl> <dbl> <dbl> <dbl>
1 8 ... 0 0 1 1
2 4 ... 0 0 1 0
3 3 ... 0 1 0 1
4 2 ... 1 0 0 0
5 9 ... 0 0 1 1
# ... with 327 more rows
R의 모델링 엔진
step_dummy() 전처리 없이 명목형 예측 변수를 사용할 수 있습니다
recipes 패키지는 명목형 예측 변수를 표준화된 방식으로 준비합니다
R에서 tidymodels로 모델링하기