Python 树模型机器学习
Elie Kawerk
Data Scientist

找到最接近 $f$ 的模型 $\hat{f}$:$\hat{f} \approx f$
$\hat{f}$ 可为 Logistic Regression、Decision Tree、Neural Network 等。
尽量去除噪声。
最终目标:$\hat{f}$ 在未见数据集上有低预测误差。
过拟合:
$\hat{f}(x)$ 拟合了训练集中的噪声。
欠拟合:
$\hat{f}$ 不够灵活,无法逼近 $f$。


$\hat{f}$ 的泛化误差:$\hat{f}$ 在未见数据上表现如何?
可分解为:
$\hat{f}$ 的泛化误差 = 偏差$^2$ + 方差 + 不可约误差


模型复杂度:决定 $\hat{f}$ 的灵活性。
例:最大树深、每叶最少样本数等。


Python 树模型机器学习