从 RNN / LSTM / GRU 到早期 Attention:为什么“压缩历史”最终变成了“按需读取”2026-09-13·5738 字·12 分钟Deep-Learning RNN LSTM Attention Seq2seq上一篇《从 RNN 到 LSTM,再到 GRU》把 gate 机制理了一遍:LSTM / GRU 把 recurrent state 的信息流变成了可学习的动态控制,决定什么写入、什么保留、什么暴露。写到那里,我以为 RNN 这条线差不多收尾了。
从 RNN 到 LSTM,再到 GRU:循环网络真正改变的是什么?2026-09-12·3008 字·7 分钟Deep-Learning RNN LSTM GRU最近复习 RNN、LSTM 和 GRU,我把它们的状态更新公式放在一起看。有一处值得单独想想:candidate 和 input gate 最后只是相乘,为什么要分成两组参数来学?从这个问题往回看,才能看清几个 gate 各自控制了什么。
Long Short-Term Memory (LSTM) 网络 学习笔记2017-07-31·761 字·2 分钟Deep-Learning LSTM RNN参考资料: # 维基百科_长短期记忆(LSTM)