Crearea seturilor de date de antrenare, testare și validare

Validarea modelelor în Python

Kasey Jones

Data Scientist

Împărțirea tradițională antrenare/testare

  • Date văzute (utilizate pentru antrenare)
  • Date nevăzute (indisponibile la antrenare)

Împărțirea datelor presupune utilizarea unei porțiuni din datele disponibile pentru antrenare și a unei porțiuni mai mici pentru testare.

Validarea modelelor în Python

Definiții și rapoarte pentru seturi de date

Set de date Definiție
Antrenare Eșantionul utilizat la ajustarea modelelor
Testare (eșantion rezervă) Eșantionul utilizat pentru evaluarea performanței

Exemple de rapoarte

  • 80:20
  • 90:10 (utilizat când datele sunt puține)
  • 70:30 (utilizat când modelul este costisitor computațional)
Validarea modelelor în Python

Seturile de date X și y

import pandas as pd

tic_tac_toe = pd.read_csv("tic-tac-toe.csv")
X = pd.get_dummies(tic_tac_toe.iloc[:,0:9])
y = tic_tac_toe.iloc[:, 9]

Cursuri Python despre variabile dummy:

Validarea modelelor în Python

Crearea eșantioanelor de rezervă

X_train, X_test, y_train, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)

Parametri:

  • test_size
  • train_size
  • random_state
Validarea modelelor în Python

Set de date pentru testarea preliminară?

Ce facem când testăm diferiți parametri ai modelului?

  • 100 față de 1000 de arbori
Validarea modelelor în Python

Pentru a testa parametrii modelului, datele disponibile trebuie împărțite în trei părți: una pentru antrenare, una pentru validare și una pentru testare.

Validarea modelelor în Python

Antrenare, validare și testare — continuare

X_temp, X_test, y_temp, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)
X_train, X_val, y_train, y_val =\
    train_test_split(X_temp, y_temp, test_size=0.25, random_state=11111)
Validarea modelelor în Python

Exercițiu cu eșantioane de rezervă

Validarea modelelor în Python

Preparing Video For Download...