Automatiser le flux de modélisation

Modélisation avec tidymodels en R

David Svancer

Data Scientist

Rationaliser le flux de travail

La fonction last_fit()

  • Accepte aussi les modèles de classification
  • Accélère la modélisation
  • Ajuste le modèle aux données d'entraînement et génère des prédictions sur l'ensembledetest

 

Comme avec fit(), les premières étapes :

  • Créer un objet de partition des données avec rsample
  • Définir un modèle avec parsnip
leads_split <- initial_split(leads_df, 
                             strata = purchased)

logistic_model <- logistic_reg() %>% set_engine('glm') %>% set_mode('classification')
Modélisation avec tidymodels en R

Ajuster le modèle et recueillir les mesures

La fonction last_fit()

  • Objet modèle parsnip
  • Formule du modèle
  • Objet de partition des données

 

La fonction collect_metrics() calcule les mesures avec l'ensemble de test

  • Précision (accuracy) et ROC AUC par défaut
logistic_last_fit <- logistic_model %>% 
  last_fit(purchased ~ total_visits + total_time,
           split = leads_split)

logistic_last_fit %>% collect_metrics()

 

# A tibble: 2 x 3
  .metric  .estimator .estimate
  <chr>      <chr>       <dbl>
1 accuracy   binary      0.759
2 roc_auc    binary      0.763
Modélisation avec tidymodels en R

Recueillir les prédictions

collect_predictions()

  • Crée un tibble avec toutes les colonnes nécessaires aux fonctions yardstick
  • Résultats réels et prédits avec les données de test
  • Colonnes de probabilités estimées pour toutes les catégories d'issue
last_fit_results <- logistic_last_fit %>% 
  collect_predictions()
last_fit_results
# A tibble: 332 x 6
   id             .pred_yes .pred_no .row .pred_class purchased
   <chr>            <dbl>    <dbl>   <int>   <fct>      <fct>
 1 train/test split  0.134    0.866     2      no        no
 2 train/test split  0.729    0.271    17      yes       yes
 3 train/test split  0.133    0.867    21      no        no
 4 train/test split  0.0916   0.908    22      no        no
 5 train/test split  0.598    0.402    24      yes       yes
# ... with 327 more rows
Modélisation avec tidymodels en R

Ensembles de mesures personnalisés

La fonction metric_set()

  • accuracy(), sens() et spec()
    • Exigent les arguments truth et estimate
  • roc_auc()
    • Exige truth et une colonne de probabilités estimées

 

La fonction custom_metrics() aura besoin des trois, avec .pred_yes en dernier argument

custom_metrics <- metric_set(accuracy, sens,
                             spec, roc_auc)
custom_metrics(last_fit_results,
               truth = purchased,
               estimate = .pred_class,
               .pred_yes)
# A tibble: 4 x 3
  .metric  .estimator .estimate
  <chr>    <chr>          <dbl>
1 accuracy binary         0.759
2 sens     binary         0.617
3 spec     binary         0.840
4 roc_auc  binary         0.763
Modélisation avec tidymodels en R

Passons à la pratique !

Modélisation avec tidymodels en R

Preparing Video For Download...