Введение в глубокое обучение с PyTorch
Jasmin Ludolf
Senior Data Science Content Developer, DataCamp
Оптимизатор Stochastic Gradient Descent (SGD)
sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)



Это выпуклая функция.

Это невыпуклая функция.

lr = 0.01 momentum = 0, после 100 шагов минимум найден при x = -1.23 и y = -0.14
lr = 0.01 momentum = 0.9, после 100 шагов минимум найден при x = 0.92 и y = -2.04
$$
| Скорость обучения | Импульс |
|---|---|
| Управляет размером шага | Управляет инерцией |
| Слишком высокая → низкое качество | Помогает выйти из локального минимума |
| Слишком низкая → медленное обучение | Слишком малый → оптимизатор застревает |
| Типичный диапазон: 0,01 ($10^{-2}$) и 0,0001 ($10^{-4}$) | Типичный диапазон: 0,85–0,99 |
Введение в глубокое обучение с PyTorch