लर्निंग रेट और मोमेंटम

PyTorch के साथ Deep Learning परिचय

Jasmin Ludolf

Senior Data Science Content Developer, DataCamp

SGD से वेट्स अपडेट करना

  • न्यूरल नेटवर्क का प्रशिक्षण = एक optimization problem हल करना।

Stochastic Gradient Descent (SGD) optimizer

sgd = optim.SGD(model.parameters(), lr=0.01, momentum=0.95)
  • दो आर्ग्यूमेंट:
    • learning rate: स्टेप साइज नियंत्रित करता है
    • momentum: जड़ता जोड़ता है ताकि फँसे नहीं
PyTorch के साथ Deep Learning परिचय

लर्निंग रेट का प्रभाव: आदर्श learning rate

उचित learning rate का उदाहरण

  • ग्रेडिएंट छोटा होते ही शून्य के पास स्टेप साइज घटता है
PyTorch के साथ Deep Learning परिचय

लर्निंग रेट का प्रभाव: छोटा learning rate

छोटे learning rate का उदाहरण

PyTorch के साथ Deep Learning परिचय

लर्निंग रेट का प्रभाव: बड़ा learning rate

बहुत बड़े learning rate का उदाहरण

PyTorch के साथ Deep Learning परिचय

Convex और non-convex functions

यह एक convex function है।

convex function का उदाहरण

यह एक non-convex function है।

non-convex function का उदाहरण

  • लॉस फंक्शन सामान्यतः non-convex होते हैं
PyTorch के साथ Deep Learning परिचय

मोमेंटम के बिना

  • lr = 0.01 momentum = 0, 100 स्टेप के बाद न्यूनतम मिला: x = -1.23 और y = -0.14

local minimum में फँसने का उदाहरण

PyTorch के साथ Deep Learning परिचय

मोमेंटम के साथ

  • lr = 0.01 momentum = 0.9, after 100 steps minimum found for x = 0.92 and y = -2.04

an example of optimization with momentum

PyTorch के साथ Deep Learning परिचय

सारांश

$$

Learning Rate Momentum
स्टेप साइज नियंत्रित करता है जड़ता नियंत्रित करता है
बहुत ज्यादा → खराब प्रदर्शन लोकल मिनिमम से निकलने में मदद
बहुत कम → धीमा प्रशिक्षण बहुत कम → optimizer फँस सकता है
सामान्य रेंज: 0.01 ($10^{-2}$) और 0.0001 ($10^{-4}$) सामान्य रेंज: 0.85 से 0.99
PyTorch के साथ Deep Learning परिचय

अभ्यास करते हैं!

PyTorch के साथ Deep Learning परिचय

Preparing Video For Download...