Uczenie maszynowe z modelami drzewiastymi w Pythonie
Elie Kawerk
Data Scientist

Znaleźć model $\hat{f}$ najlepiej przybliżający $f$: $\hat{f} \approx f$
$\hat{f}$ może być regresją logistyczną, drzewem decyzyjnym, siecią neuronową...
Eliminować szum w jak największym stopniu.
Cel końcowy: $\hat{f}$ powinien osiągać niski błąd predykcji na nowych danych.
Przeuczenie (Overfitting):
$\hat{f}(x)$ dopasowuje się do szumu w zbiorze treningowym.
Niedouczenie (Underfitting):
$\hat{f}$ nie jest wystarczająco elastyczny, aby przybliżyć $f$.


Błąd generalizacji $\hat{f}$: Czy $\hat{f}$ dobrze generalizuje na nowych danych?
Można go rozłożyć następująco:
Błąd generalizacji $\hat{f} = bias^2 + variance + \text{irreducible error}$


Złożoność modelu: określa elastyczność $\hat{f}$.
Przykład: maksymalna głębokość drzewa, minimalna liczba próbek w liściu, ...


Uczenie maszynowe z modelami drzewiastymi w Pythonie