Aperçu des hyperparamètres

Ajustement des hyperparamètres en Python

Alex Scriven

Data Scientist

Qu'est-ce qu'un hyperparamètre

Hyperparamètres :

  • Paramètres que vous réglez avant l'entraînement (comme des cadrans de vieille radio)
    • Vous pouvez aussi « ajuster » vos hyperparamètres !
  • L'algorithme ne les apprend pas

Vieille radio avec cadrans

Ajustement des hyperparamètres en Python

Hyperparamètres dans Random Forest

Créez un estimateur Random Forest simple et affichez-le :

rf_clf = RandomForestClassifier()
print(rf_clf)

RandomForestClassifier(n_estimators='warn', criterion='gini', max_depth=None, max_features='auto', max_leaf_nodes=None, min_impurity_decrease=0.0, min_impurity_split=None, min_samples_leaf=1, min_samples_split=2, min_weight_fraction_leaf=0.0, n_jobs=None, oob_score=False, random_state=None, verbose=0,bootstrap=True, class_weight=None, warm_start=False)

Plus d'info : http://scikit-learn.org

Ajustement des hyperparamètres en Python

Un seul hyperparamètre

Prenez le paramètre n_estimators.

Type et valeur par défaut :

n_estimators : integer, optional (default=10)

Définition :

The number of trees in the forest.

Ajustement des hyperparamètres en Python

Configurer des hyperparamètres

Définissez des hyperparamètres à la création de l'estimateur :

rf_clf = RandomForestClassifier(n_estimators=100, criterion='entropy')
print(rf_clf)
RandomForestClassifier(n_estimators=100, criterion='entropy',
            max_depth=None, max_features='auto', max_leaf_nodes=None,
            min_impurity_decrease=0.0, min_impurity_split=None,
            min_samples_leaf=1, min_samples_split=2,
            min_weight_fraction_leaf=0.0, n_jobs=None,
            oob_score=False, random_state=None, verbose=0,bootstrap=True,
            class_weight=None, warm_start=False)
Ajustement des hyperparamètres en Python

Hyperparamètres en régression logistique

Trouvez les hyperparamètres d'une régression logistique :

log_reg_clf = LogisticRegression()

print(log_reg_clf) LogisticRegression(C=1.0, class_weight=None, dual=False, fit_intercept=True, intercept_scaling=1, max_iter=100, multi_class='warn', n_jobs=None, penalty='l2', random_state=None, solver='warn', tol=0.0001, verbose=0, warm_start=False)

Il y a moins d'hyperparamètres à ajuster avec cet algorithme !

Ajustement des hyperparamètres en Python

Importance des hyperparamètres

 

Certains hyperparamètres comptent plus que d'autres.

Certains n'améliorent pas les performances :

Pour le classificateur Random Forest :

  • n_jobs
  • random_state
  • verbose

Tous les hyperparamètres ne valent pas la peine d'être « entraînés »

Ajustement des hyperparamètres en Python

Random Forest : hyperparamètres importants

 

Hyperparamètres importants :

  • n_estimators (valeur élevée)
  • max_features (essayer différentes valeurs)
  • max_depth et min_sample_leaf (clés pour le surapprentissage)
  • (peut-être) criterion

Rappel : ce n'est qu'un guide

Ajustement des hyperparamètres en Python

Comment repérer les hyperparamètres qui comptent ?

 

Ressources utiles :

  • Articles scientifiques
  • Blogues et tutoriels de sources fiables (comme DataCamp !)
  • Documentation du module Scikit-learn
  • Expérience
Ajustement des hyperparamètres en Python

Passons à la pratique !

Ajustement des hyperparamètres en Python

Preparing Video For Download...