Train, Test, और Validation डेटासेट बनाना

Python में Model Validation

Kasey Jones

Data Scientist

पारंपरिक train/test स्प्लिट

  • Seen data (ट्रेनिंग में उपयोग)
  • Unseen data (ट्रेनिंग में उपलब्ध नहीं)

डेटा स्प्लिटिंग में उपलब्ध डेटा का बड़ा हिस्सा ट्रेनिंग के लिए, और छोटा हिस्सा टेस्टिंग डेटासेट के लिए रखा जाता है.

Python में Model Validation

डेटासेट की परिभाषाएँ और अनुपात

Dataset परिभाषा
Train मॉडल फिट करने के लिए उपयोग किया गया डेटा सैंपल
Test (holdout sample) मॉडल के प्रदर्शन का आकलन करने का डेटा सैंपल

अनुपात के उदाहरण

  • 80:20
  • 90:10 (जब डेटा कम हो)
  • 70:30 (जब मॉडल गणनात्मक रूप से महँगा हो)
Python में Model Validation

X और y डेटासेट

import pandas as pd

tic_tac_toe = pd.read_csv("tic-tac-toe.csv")
X = pd.get_dummies(tic_tac_toe.iloc[:,0:9])
y = tic_tac_toe.iloc[:, 9]

डमी वैरिएबल कवर करने वाले Python कोर्स:

Python में Model Validation

Holdout सैंपल बनाना

X_train, X_test, y_train, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)

पैरामीटर:

  • test_size
  • train_size
  • random_state
Python में Model Validation

प्रारंभिक टेस्टिंग के लिए डेटासेट?

जब अलग-अलग मॉडल पैरामीटर टेस्ट करते हैं तो क्या करें?

  • 100 बनाम 1000 ट्रीज़
Python में Model Validation

मॉडल पैरामीटर टेस्ट करने के लिए, उपलब्ध डेटा को तीन भागों में बाँटें: एक ट्रेनिंग, एक validation, और एक टेस्टिंग के लिए.

Python में Model Validation

Train, validation, test जारी

X_temp, X_test, y_temp, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)
X_train, X_val, y_train, y_val =\
    train_test_split(X_temp, y_temp, test_size=0.25, random_state=11111)
Python में Model Validation

अब holdout का समय

Python में Model Validation

Preparing Video For Download...