·3267 words·7 mins
最近重新复习经典序列模型时,我发现很多资料倾向于把重点放在“门(gate)”的数量和复杂公式的罗列上。在真实工程场景中,我们往往更关心这些设计背后的 trade-off。机缘使然,我尝试从 architecture design 的角度重新整理这些经典模型。
·5623 words·12 mins
最近在重新跟 MIT 6.S191 和 CS336,发现自己处在一个有点尴尬的状态:RNN 的 forward 随时能默写,hidden state 一步一步往前推,没什么好想的。但如果有人接着问"那它到底怎么 backward",我能说出来的只剩几个词——BPTT、沿时间反向传播、梯度消失——再往下就模糊了。
·3082 words·7 mins
最近在重拾一些深度学习基础,发现了一个很有意思的视角。
以前在看 RNN(Recurrent Neural Network)的长距离梯度传播公式时,总能看到一堆 Jacobian 矩阵的连乘,比如 \(\frac{\partial h_T}{\partial h_0} = J_T J_{T-1} \dots J_1\)。
·3582 words·8 mins
起因 # 上一篇把 RNN 拆成了两层:state transition 和 output projection。State transition 维护 hidden state,output projection 从 hidden state 中映射出当前任务需要的预测结果。
·3399 words·7 mins
起因 # 最近在复习 MIT 6.S191 的 RNN 部分,看到下面这张 slide 时停了一下。
·997 words·2 mins
参考资料: # 维基百科_长短期记忆(LSTM)
Understanding LSTM Networks
[译] 理解 LSTM 网络