Python में Tree-Based Models के साथ Machine Learning
Elie Kawerk
Data Scientist

ऐसा मॉडल $\hat{f}$ खोजें जो $f$ के सबसे करीब हो: $\hat{f} \approx f$
$\hat{f}$ Logistic Regression, Decision Tree, Neural Network ... हो सकता है।
शोर को यथासंभव हटा दें।
अंतिम लक्ष्य: अनदेखे डेटासेट पर $\hat{f}$ की predictive error कम हो।
Overfitting:
$\hat{f}(x)$ training सेट के शोर को भी फिट करता है।
Underfitting:
$\hat{f}$, $f$ को approx करने के लिए पर्याप्त flexible नहीं है।


$\hat{f}$ की Generalization Error: क्या $\hat{f}$ अनदेखे data पर अच्छा generalize करता है?
इसे यूँ लिखा जा सकता है:
$\hat{f}$ की Generalization Error = bias^2 + variance + \text{irreducible error}


Model Complexity: $\hat{f}$ की flexibility तय करती है।
उदाहरण: Maximum tree depth, Minimum samples per leaf, ...


Python में Tree-Based Models के साथ Machine Learning