PyTorchで学ぶIntroduction to Deep Learning
Jasmin Ludolf
Senior Data Science Content Developer, DataCamp
確率的勾配降下法 (SGD) オプティマイザ
sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)



これは凸関数です。

これは非凸関数です。

lr = 0.01 momentum = 0、100ステップ後に x = -1.23、y = -0.14 の最小値を発見
lr = 0.01 momentum = 0.9、100ステップ後に x = 0.92、y = -2.04 の最小値を発見
$$
| 学習率 | モメンタム |
|---|---|
| ステップ幅を制御 | 慣性を制御 |
| 高すぎる → 性能低下 | 局所最小からの脱出を支援 |
| 低すぎる → 学習が遅い | 小さすぎる → 最適化が停滞 |
| 典型範囲: 0.01 ($10^{-2}$) ~ 0.0001 ($10^{-4}$) | 典型範囲: 0.85~0.99 |
PyTorchで学ぶIntroduction to Deep Learning