泛化误差

Python 树模型机器学习

Elie Kawerk

Data Scientist

监督学习:幕后机制

  • 监督学习:$y = f(x)$,$f$ 未知。

含噪数据集

Python 树模型机器学习

监督学习的目标

  • 找到最接近 $f$ 的模型 $\hat{f}$:$\hat{f} \approx f$

  • $\hat{f}$ 可为 Logistic Regression、Decision Tree、Neural Network 等。

  • 尽量去除噪声。

  • 最终目标:$\hat{f}$ 在未见数据集上有低预测误差。

Python 树模型机器学习

逼近 $f$ 的难点

  • 过拟合

    $\hat{f}(x)$ 拟合了训练集中的噪声。

  • 欠拟合

    $\hat{f}$ 不够灵活,无法逼近 $f$。

Python 树模型机器学习

过拟合

过拟合

Python 树模型机器学习

欠拟合

欠拟合

Python 树模型机器学习

泛化误差

  • $\hat{f}$ 的泛化误差:$\hat{f}$ 在未见数据上表现如何?

  • 可分解为:

    $\hat{f}$ 的泛化误差 = 偏差$^2$ + 方差 + 不可约误差

Python 树模型机器学习

偏差

  • 偏差(Bias):平均来看,$\hat{f}$ 与 $f$ 的偏离量。

高偏差

Python 树模型机器学习

方差

  • 方差(Variance):$\hat{f}$ 在不同训练集上的不一致程度。

高方差

Python 树模型机器学习

模型复杂度

  • 模型复杂度:决定 $\hat{f}$ 的灵活性。

  • 例:最大树深、每叶最少样本数等。

Python 树模型机器学习

偏差-方差权衡

泛化误差分解

Python 树模型机器学习

偏差-方差权衡:直观解释

偏差-方差可视化

Python 树模型机器学习

Passons à la pratique !

Python 树模型机器学习

Preparing Video For Download...