Machine Learning with Tree-Based Models in Python
Elie Kawerk
Data Scientist

Nalezení modelu $\hat{f}$, který nejlépe aproximuje $f$: $\hat{f} \approx f$
$\hat{f}$ může být logistická regrese, rozhodovací strom, neuronová síť ...
Maximálně eliminovat šum.
Cíl: $\hat{f}$ by mělo dosáhnout nízké predikční chyby na neviděných datech.
Přetrénování (Overfitting):
$\hat{f}(x)$ se přizpůsobí šumu trénovací sady.
Nedostatečné trénování (Underfitting):
$\hat{f}$ není dostatečně flexibilní pro aproximaci $f$.


Chyba zobecnění $\hat{f}$: Zobecňuje $\hat{f}$ dobře na neviděná data?
Lze ji rozložit takto:
Chyba zobecnění $\hat{f} = bias^2 + variance + \text{irreducible error}$


Složitost modelu: určuje flexibilitu $\hat{f}$.
Příklady: maximální hloubka stromu, minimální počet vzorků v listu, ...


Machine Learning with Tree-Based Models in Python