Python में Tree-Based Models के साथ Machine Learning
Elie Kawerk
Data Scientist
CART हाइपरपैरामीटर्स
estimators की संख्या
bootstrap
....
हाइपरपैरामीटर ट्यूनिंग:
कम्प्यूटेशनली महंगी,
कई बार बस हल्का सुधार देती है,
ट्यूनिंग के प्रभाव को पूरे प्रोजेक्ट पर तौलें.
# Import RandomForestRegressor
from sklearn.ensemble import RandomForestRegressor
# Set seed for reproducibility
SEED = 1
# Instantiate a random forests regressor 'rf'
rf = RandomForestRegressor(random_state= SEED)
# rf के हाइपरपैरामीटर्स देखें
rf.get_params()
{'bootstrap': True,
'criterion': 'mse',
'max_depth': None,
'max_features': 'auto',
'max_leaf_nodes': None,
'min_impurity_decrease': 0.0,
'min_impurity_split': None,
'min_samples_leaf': 1,
'min_samples_split': 2,
'min_weight_fraction_leaf': 0.0,
'n_estimators': 10,
'n_jobs': -1,
'oob_score': False,
'random_state': 1,
'verbose': 0,
'warm_start': False}
# Basic imports from sklearn.metrics import mean_squared_error as MSE from sklearn.model_selection import GridSearchCV# 'params_rf' हाइपरपैरामीटर ग्रिड परिभाषित करें params_rf = { 'n_estimators': [300, 400, 500], 'max_depth': [4, 6, 8], 'min_samples_leaf': [0.1, 0.2], 'max_features': ['log2', 'sqrt'] }# 'grid_rf' इंस्टैंशिएट करें grid_rf = GridSearchCV(estimator=rf, param_grid=params_rf, cv=3, scoring='neg_mean_squared_error', verbose=1, n_jobs=-1)
# प्रशिक्षण सेट पर 'grid_rf' फिट करें
grid_rf.fit(X_train, y_train)
Fitting 3 folds for each of 36 candidates, totalling 108 fits
[Parallel(n_jobs=-1)]: Done 42 tasks | elapsed: 10.0s
[Parallel(n_jobs=-1)]: Done 108 out of 108 | elapsed: 24.3s finished
RandomForestRegressor(bootstrap=True, criterion='mse', max_depth=4,
max_features='log2', max_leaf_nodes=None,
min_impurity_decrease=0.0, min_impurity_split=None,
min_samples_leaf=0.1, min_samples_split=2,
min_weight_fraction_leaf=0.0, n_estimators=400, n_jobs=1,
oob_score=False, random_state=1, verbose=0, warm_start=False)
# 'grid_rf' से सर्वश्रेष्ठ हाइपरपैरामीटर्स निकालें
best_hyperparams = grid_rf.best_params_
print('Best hyperparameters:\n', best_hyperparams)
Best hyperparameters:
{'max_depth': 4,
'max_features': 'log2',
'min_samples_leaf': 0.1,
'n_estimators': 400}
# 'grid_rf' से सर्वश्रेष्ठ मॉडल निकालें
best_model = grid_rf.best_estimator_
# टेस्ट सेट लेबल्स भविष्यवाणी करें
y_pred = best_model.predict(X_test)
# टेस्ट सेट RMSE आँकें
rmse_test = MSE(y_test, y_pred)**(1/2)
# टेस्ट सेट RMSE प्रिंट करें
print('Test set RMSE of rf: {:.2f}'.format(rmse_test))
Test set RMSE of rf: 3.89
Python में Tree-Based Models के साथ Machine Learning