Machine Learning cu modele bazate pe arbori în Python
Elie Kawerk
Data Scientist

Găsiți un model $\hat{f}$ care aproximează cel mai bine $f$: $\hat{f} \approx f$
$\hat{f}$ poate fi Regresie Logistică, Arbore de Decizie, Rețea Neuronală ...
Eliminați zgomotul pe cât posibil.
Obiectiv final: $\hat{f}$ trebuie să obțină o eroare de predicție redusă pe date noi.
Supraajustare:
$\hat{f}(x)$ se ajustează pe zgomotul din setul de antrenament.
Subajustare:
$\hat{f}$ nu este suficient de flexibil pentru a aproxima $f$.


Eroarea de generalizare a lui $\hat{f}$: $\hat{f}$ generalizează bine pe date noi?
Poate fi descompusă astfel:
Eroarea de generalizare a lui $\hat{f} = bias^2 + variance + \text{eroare ireductibilă}$


Complexitatea modelului: stabilește flexibilitatea lui $\hat{f}$.
Exemple: adâncimea maximă a arborelui, numărul minim de eșantioane per frunză, ...


Machine Learning cu modele bazate pe arbori în Python