使用 PyTorch 的深度學習入門
Jasmin Ludolf
Senior Data Science Content Developer, DataCamp
隨機梯度下降(SGD)最佳化器
sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)



這是凸函式。

這是非凸函式。

lr = 0.01、momentum = 0,100 步後在 x = -1.23、y = -0.14 找到極小值
lr = 0.01、momentum = 0.9,100 步後在 x = 0.92、y = -2.04 找到極小值
$$
| Learning Rate | Momentum |
|---|---|
| 控制步長 | 控制慣性 |
| 過大 → 表現不佳 | 有助逃離局部極小值 |
| 過小 → 訓練緩慢 | 過小 → 最佳化器易卡住 |
| 常見範圍:0.01($10^{-2}$)與 0.0001($10^{-4}$) | 常見範圍:0.85 到 0.99 |
使用 PyTorch 的深度學習入門