Introducere în validarea modelelor

Validarea modelelor în Python

Kasey Jones

Data Scientist

Ce este validarea modelului?

Validarea modelului constă în:

  • Verificarea performanței modelului pe date noi
  • Testarea performanței pe seturi de date holdout
  • Selectarea celui mai bun model, parametri și metrici de acuratețe
  • Obținerea celei mai bune acuratețe pentru datele disponibile
Validarea modelelor în Python

Recapitulare modelare scikit-learn

Pași de bază în modelare:

model = RandomForestRegressor(n_estimators=500, random_state=1111)

model.fit(X=X_train, y=y_train)
RandomForestRegressor(bootstrap=True, criterion='mse', max_depth=None,
           max_features='auto', max_leaf_nodes=None,
           min_impurity_decrease=0.0, min_impurity_split=None,
           min_samples_leaf=1, min_samples_split=2,
           min_weight_fraction_leaf=0.0, n_estimators=500, n_jobs=1,
           oob_score=False, random_state=1111, verbose=0, warm_start=False)
Validarea modelelor în Python

Continuarea recapitulării modelării

predictions = model.predict(X_test)

print("{0:.2f}".format(mae(y_true=y_test, y_pred=predictions)))
10.84

Formula erorii medii absolute

$$ \frac{\sum_{i=1}^{n} |y_i - \hat{y}_i|}{n} $$

Validarea modelelor în Python

Condiții prealabile

Validarea modelelor în Python

Fivethirtyeight conține mai multe seturi de date, inclusiv clasamentul dulciurilor de Halloween. Fiecare dulce are un procent de câștig cap la cap între 0 și 100%.

Validarea modelelor în Python

Date văzute vs. nevăzute

Date de antrenament = date văzute

model = RandomForestRegressor(n_estimators=500, random_state=1111)
model.fit(X_train, y_train)
train_predictions = model.predict(X_train)

Date de test = date nevăzute

model = RandomForestRegressor(n_estimators=500, random_state=1111)
model.fit(X_train, y_train)
test_predictions = model.predict(X_test)
Validarea modelelor în Python

Să începem!

Validarea modelelor în Python

Preparing Video For Download...