从 RNN / LSTM / GRU 到早期 Attention:为什么“压缩历史”最终变成了“按需读取”Sep 13, 2026·5735 words·12 minsDeep-Learning RNN LSTM Attention Seq2seq上一篇《从 RNN 到 LSTM,再到 GRU》把 gate 机制理了一遍:LSTM / GRU 把 recurrent state 的信息流变成了可学习的动态控制,决定什么写入、什么保留、什么暴露。写到那里,我以为 RNN 这条线差不多收尾了。