Машинное обучение на основе древовидных моделей в Python
Elie Kawerk
Data Scientist

Найти модель $\hat{f}$, наилучшим образом аппроксимирующую $f$: $\hat{f} \approx f$
$\hat{f}$ может быть логистической регрессией, деревом решений, нейронной сетью...
По возможности отфильтровать шум.
Конечная цель: $\hat{f}$ должна давать низкую ошибку предсказания на новых данных.
Переобучение:
$\hat{f}(x)$ подстраивается под шум обучающей выборки.
Недообучение:
$\hat{f}$ недостаточно гибка для аппроксимации $f$.


Ошибка обобщения $\hat{f}$: насколько хорошо $\hat{f}$ обобщается на новых данных?
Её можно разложить следующим образом:
Ошибка обобщения $\hat{f} = bias^2 + variance + \text{irreducible error}$


Сложность модели: определяет гибкость $\hat{f}$.
Примеры: максимальная глубина дерева, минимальное число объектов в листе...


Машинное обучение на основе древовидных моделей в Python