PyTorch로 배우는 딥러닝 입문
Jasmin Ludolf
Senior Data Science Content Developer, DataCamp
확률적 경사 하강법(SGD) 옵티마이저
sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)



이는 볼록 함수입니다.

이는 비볼록 함수입니다.

lr = 0.01 momentum = 0, 100스텝 후 최소값: x = -1.23, y = -0.14
lr = 0.01 momentum = 0.9, 100스텝 후 최소값: x = 0.92, y = -2.04
$$
| 학습률 | 모멘텀 |
|---|---|
| 스텝 크기를 조절 | 관성을 조절 |
| 너무 크면 → 성능 저하 | 로컬 최소값 탈출에 도움 |
| 너무 작으면 → 학습 지연 | 너무 작으면 → 옵티마이저가 갇힘 |
| 일반 범위: 0.01 ($10^{-2}$) ~ 0.0001 ($10^{-4}$) | 일반 범위: 0.85 ~ 0.99 |
PyTorch로 배우는 딥러닝 입문