使用 PyTorch 的深度学习入门
Jasmin Ludolf
Senior Data Science Content Developer, DataCamp
随机梯度下降(SGD)优化器
sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)



这是一个凸函数。

这是一个非凸函数。

lr = 0.01 momentum = 0,100 步后在 x = -1.23、y = -0.14 处找到极小值
lr = 0.01 momentum = 0.9,100 步后在 x = 0.92、y = -2.04 处找到极小值
$$
| 学习率 | 动量 |
|---|---|
| 控制步长 | 控制惯性 |
| 过高 → 表现差 | 帮助跳出局部极小值 |
| 过低 → 训练慢 | 过小 → 优化器会卡住 |
| 常见范围:0.01 ($10^{-2}$) 到 0.0001 ($10^{-4}$) | 常见范围:0.85–0.99 |
使用 PyTorch 的深度学习入门