Créer les ensembles d'entraînement, de test et de validation

Validation de modèles en Python

Kasey Jones

Data Scientist

Scission entraînement/test traditionnelle

  • Données vues (utilisées pour l'entraînement)
  • Données non vues (non disponibles pour l'entraînement)

Scinder les données consiste à utiliser une partie de toutes les données pour l'entraînement et une plus petite partie pour l'ensemble de test.

Validation de modèles en Python

Définitions et ratios des ensembles

Ensemble de données Définition
Train Échantillon de données pour ajuster les modèles
Test (échantillon de réserve) Échantillon pour évaluer la performance du modèle

Exemples de ratios

  • 80:20
  • 90:10 (lorsqu'on a peu de données)
  • 70:30 (si l'entraînement est coûteux en calcul)
Validation de modèles en Python

Les ensembles X et y

import pandas as pd

tic_tac_toe = pd.read_csv("tic-tac-toe.csv")
X = pd.get_dummies(tic_tac_toe.iloc[:,0:9])
y = tic_tac_toe.iloc[:, 9]

Cours Python sur les variables factices :

Validation de modèles en Python

Créer des échantillons de réserve

X_train, X_test, y_train, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)

Paramètres :

  • test_size
  • train_size
  • random_state
Validation de modèles en Python

Ensemble pour tests préliminaires ?

Que faire pour tester différents hyperparamètres ?

  • 100 versus 1000 arbres
Validation de modèles en Python

Pour tester des paramètres de modèle, il faut scinder les données en trois parties : entraînement, validation et test.

Validation de modèles en Python

Entraînement, validation, test : suite

X_temp, X_test, y_temp, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)
X_train, X_val, y_train, y_val =\
    train_test_split(X_temp, y_temp, test_size=0.25, random_state=11111)
Validation de modèles en Python

Place aux échantillons de réserve

Validation de modèles en Python

Preparing Video For Download...