Introduction au Deep Learning avec PyTorch
Jasmin Ludolf
Senior Data Science Content Developer, DataCamp
Optimiseur Stochastic Gradient Descent (SGD)
sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)



Ceci est une fonction convexe.

Ceci est une fonction non convexe.

lr = 0.01 momentum = 0, après 100 pas : minimum trouvé pour x = -1.23 et y = -0.14
lr = 0.01 momentum = 0.9, après 100 pas : minimum trouvé pour x = 0.92 et y = -2.04
$$
| Learning Rate | Momentum |
|---|---|
| Contrôle la taille du pas | Contrôle l'inertie |
| Trop élevé → faibles performances | Aide à sortir d'un minimum local |
| Trop faible → entraînement lent | Trop petit → l'optimiseur se coince |
| Plage typique : 0,01 ($10^{-2}$) à 0,0001 ($10^{-4}$) | Plage typique : 0,85 à 0,99 |
Introduction au Deep Learning avec PyTorch