Mạng nơ-ron hồi quy (RNN) cho Mô hình ngôn ngữ với Keras
David Cecchini
Data Scientist


Ví dụ: $$a_2 = f(W_a, a_1, x_2)$$
$$= f(W_a, f(W_a, a_0, x_1), x_2)$$

Hãy nhớ rằng:
$$ a_T = f(W_a, a_{T-1}, x_T) $$
$a_T$ cũng phụ thuộc vào $a_{T-1}$, phụ thuộc vào $a_{T-2}$ và $W_a$, v.v.
Tính đạo hàm dẫn đến
$$ \frac{\partial a_t}{\partial W_a} = (W_a)^{t-1}g(X) $$
$(W_a)^{t-1}$ có thể hội tụ về 0
hoặc diverge đến $+\infty$!
Một số giải pháp đã biết:
Gradient bùng nổ
Gradient biến mất
Mạng nơ-ron hồi quy (RNN) cho Mô hình ngôn ngữ với Keras