Вступ до Deep Learning з PyTorch
Jasmin Ludolf
Senior Data Science Content Developer, DataCamp
Оптимізатор Stochastic Gradient Descent (SGD)
sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)



Це опукла функція.

Це неопукла функція.

lr = 0.01 momentum = 0, після 100 кроків мінімум знайдено при x = -1.23 та y = -0.14
lr = 0.01 momentum = 0.9, після 100 кроків мінімум знайдено при x = 0.92 та y = -2.04
$$
| Learning Rate | Momentum |
|---|---|
| Керує розміром кроку | Керує інерцією |
| Надто велика → низька якість | Допомагає вийти з локального мінімуму |
| Надто мала → повільне навчання | Надто малий → оптимізатор застрягає |
| Типовий діапазон: 0.01 ($10^{-2}$) і 0.0001 ($10^{-4}$) | Типовий діапазон: 0.85–0.99 |
Вступ до Deep Learning з PyTorch