मॉडल वैलिडेशन का परिचय

Python में Model Validation

Kasey Jones

Data Scientist

मॉडल वैलिडेशन क्या है?

मॉडल वैलिडेशन में शामिल है:

  • नया डेटा पर मॉडल का अपेक्षित प्रदर्शन सुनिश्चित करना
  • होल्डआउट डेटासेट्स पर प्रदर्शन टेस्ट करना
  • सर्वश्रेष्ठ मॉडल, पैरामीटर्स, और एक्युरेसी मेट्रिक्स चुनना
  • दिए गए डेटा पर सर्वोत्तम एक्युरेसी पाना
Python में Model Validation

scikit-learn मॉडलिंग रिव्यू

बेसिक मॉडलिंग स्टेप्स:

model = RandomForestRegressor(n_estimators=500, random_state=1111)

model.fit(X=X_train, y=y_train)
RandomForestRegressor(bootstrap=True, criterion='mse', max_depth=None,
           max_features='auto', max_leaf_nodes=None,
           min_impurity_decrease=0.0, min_impurity_split=None,
           min_samples_leaf=1, min_samples_split=2,
           min_weight_fraction_leaf=0.0, n_estimators=500, n_jobs=1,
           oob_score=False, random_state=1111, verbose=0, warm_start=False)
Python में Model Validation

मॉडलिंग रिव्यू जारी

predictions = model.predict(X_test)

print("{0:.2f}".format(mae(y_true=y_test, y_pred=predictions)))
10.84

मीन एब्सोल्यूट एरर फ़ॉर्मूला

$$ \frac{\sum_{i=1}^{n} |y_i - \hat{y}_i|}{n} $$

Python में Model Validation

प्रिरिक्विज़िट्स रिव्यू करें

Python में Model Validation

Fivethirtyeight में कई डेटासेट्स हैं, जिनमें Halloween कैंडी पावर रैंकिंग डेटासेट भी शामिल है. हर कैंडी का 0 से 100% के बीच हेड-टू-हेड विन प्रतिशत है.

Python में Model Validation

Seen बनाम Unseen डेटा

ट्रेनिंग डेटा = देखा हुआ डेटा

model = RandomForestRegressor(n_estimators=500, random_state=1111)
model.fit(X_train, y_train)
train_predictions = model.predict(X_train)

टेस्टिंग डेटा = अनदेखा डेटा

model = RandomForestRegressor(n_estimators=500, random_state=1111)
model.fit(X_train, y_train)
test_predictions = model.predict(X_test)
Python में Model Validation

चलिए शुरू करते हैं!

Python में Model Validation

Preparing Video For Download...