Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras
David Cecchini
Data Scientist


Contoh: $$a_2 = f(W_a, a_1, x_2)$$
$$= f(W_a, f(W_a, a_0, x_1), x_2)$$

Ingat bahwa:
$$ a_T = f(W_a, a_{T-1}, x_T) $$
$a_T$ juga bergantung pada $a_{T-1}$ yang bergantung pada $a_{T-2}$ dan $W_a$, dan seterusnya!
Menghitung turunan menghasilkan
$$ \frac{\partial a_t}{\partial W_a} = (W_a)^{t-1}g(X) $$
$(W_a)^{t-1}$ dapat konvergen ke 0
atau divergen ke $+\infty$!
Beberapa solusi yang dikenal:
Exploding gradients
Vanishing gradients
Recurrent Neural Networks (RNN) untuk Pemodelan Bahasa dengan Keras