Kerasで学ぶ言語モデリングのためのRecurrent Neural Networks (RNNs)
David Cecchini
Data Scientist


例: $$a_2 = f(W_a, a_1, x_2)$$
$$= f(W_a, f(W_a, a_0, x_1), x_2)$$

次を思い出してください:
$$ a_T = f(W_a, a_{T-1}, x_T) $$
$a_T$ は $a_{T-1}$ に依存し、$a_{T-1}$ は $a_{T-2}$ と $W_a$ に依存…と続きます。
導関数を計算すると
$$ \frac{\partial a_t}{\partial W_a} = (W_a)^{t-1}g(X) $$
$(W_a)^{t-1}$ は 0 に収束し得る
または $+\infty$ に発散し得る!
既知の対策:
勾配爆発
勾配消失
Kerasで学ぶ言語モデリングのためのRecurrent Neural Networks (RNNs)