Modele lasu losowego

Redukcja wymiarowości w R

Matt Pickard

Owner, Pickard Predictives, LLC

Las losowy

  • Model zespołowy
    • podejście „mądrości tłumu"
  • Agreguje predykcje wielu losowych drzew
  • Losowe, nieskorelowane drzewa redukują błąd
  • Zapobiega przeuczeniu
  • Dokładny
  • Wykonuje selekcję cech

Diagram przedstawiający model zespołowy złożony z kilku drzew decyzyjnych oraz sposób łączenia ich głosów w jeden końcowy wynik.

Redukcja wymiarowości w R

Las losowy

Diagram pokazujący, jak tworzone są różne poddrzewa przy użyciu różnych podzbiorów cech.

Redukcja wymiarowości w R

Trening lasu losowego

library(tidymodels)

rf <- rand_forest(mode = "classification", trees = 200) %>% set_engine("ranger", importance = "impurity")
rf_fit <- rf %>% fit(credit_score ~ ., data = train)
predict_df <- test %>% bind_cols(predict = predict(rf_fit, test))
Redukcja wymiarowości w R

Ocena modelu

f_meas(predict_df, credit_score, .pred_class)
0.6895
Redukcja wymiarowości w R

Ważność zmiennych

library(vip)

rf_fit %>% vip()

Wykres słupkowy ważności zmiennych.

Redukcja wymiarowości w R

Maska cech

top_features <- rf_fit %>% 
  vi(rank = TRUE) %>% 
  filter(Importance <= 10) %>% 
  pull(Variable)

top_features
 [1] "outstanding_debt"        "interest_rate"          
 [3] "delay_from_due_date"     "changed_credit_limit"   
 [5] "credit_history_months"   "num_credit_card"        
 [7] "monthly_balance"         "num_of_delayed_payment" 
 [9] "annual_income"           "amount_invested_monthly"
Redukcja wymiarowości w R

Redukcja danych

train_reduced <- train[top_features]
test_reduced <- test[top_features]
Redukcja wymiarowości w R

Wydajność

rf_fit <- rf %>% 
  fit(credit_score ~ ., data = train_reduced) 

predict_reduced_df <- test_reduced %>% bind_cols(predict = predict(rf_fit, test_reduced))
f_meas(predict_reduced_df, credit_score, .pred_class)
0.6738 

F-score modelu bez redukcji:

0.6895 
Redukcja wymiarowości w R

Czas na ćwiczenia!

Redukcja wymiarowości w R

Preparing Video For Download...