从局部线性化到 RNN:理解 Jacobian 连乘Sep 12, 2026·3082 words·7 minsDeep-Learning RNN Jacobian 梯度消失最近在重拾一些深度学习基础,发现了一个很有意思的视角。 以前在看 RNN(Recurrent Neural Network)的长距离梯度传播公式时,总能看到一堆 Jacobian 矩阵的连乘,比如 \(\frac{\partial h_T}{\partial h_0} = J_T J_{T-1} \dots J_1\)。