Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)
David Cecchini
Data Scientist


उदाहरण: $$a_2 = f(W_a, a_1, x_2)$$
$$= f(W_a, f(W_a, a_0, x_1), x_2)$$

ध्यान रखें कि:
$$ a_T = f(W_a, a_{T-1}, x_T) $$
$a_T$ $a_{T-1}$ पर निर्भर है, जो $a_{T-2}$ और $W_a$ पर निर्भर है, और इसी तरह आगे!
डेरिवेटिव निकालने से मिलता है
$$ \frac{\partial a_t}{\partial W_a} = (W_a)^{t-1}g(X) $$
$(W_a)^{t-1}$ 0 की ओर सिमट सकता है
या $+\infty$ की ओर बढ़ सकता है!
कुछ ज्ञात समाधान:
Exploding gradients
Vanishing gradients
Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)