Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras
David Cecchini
Data Scientist


Příklad: $$a_2 = f(W_a, a_1, x_2)$$
$$= f(W_a, f(W_a, a_0, x_1), x_2)$$

Připomeňme si:
$$ a_T = f(W_a, a_{T-1}, x_T) $$
$a_T$ závisí také na $a_{T-1}$, které závisí na $a_{T-2}$ a $W_a$, a tak dále!
Výpočet derivací vede k
$$ \frac{\partial a_t}{\partial W_a} = (W_a)^{t-1}g(X) $$
$(W_a)^{t-1}$ může konvergovat k 0
nebo divergovat k $+\infty$!
Existují známá řešení:
Explodující gradienty
Mizející gradienty
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras