Машинне навчання з деревоподібними моделями в Python
Elie Kawerk
Data Scientist

Знайти модель $\hat{f}$, що найкраще наближує $f$: $\hat{f} \approx f$
$\hat{f}$ може бути Logistic Regression, Decision Tree, Neural Network ...
Максимально відкидати шум.
Кінцева мета: $\hat{f}$ має мати низьку помилку прогнозу на невиданих наборах даних.
Переобучення (overfitting):
$\hat{f}(x)$ підганяє шум тренувальної вибірки.
Недонавчання (underfitting):
$\hat{f}$ недостатньо гнучка, щоб наблизити $f$.


Помилка узагальнення $\hat{f}$: чи добре $\hat{f}$ узагальнює на невиданих даних?
Її можна розкласти так:
Помилка узагальнення $\hat{f} = bias^2 + variance + \text{irreducible error}$


Складність моделі: визначає гнучкість $\hat{f}$.
Приклад: максимальна глибина дерева, мінімум зразків на листок, ...


Машинне навчання з деревоподібними моделями в Python