上一篇《从 RNN 到 Self-Attention》结尾记账时留了一条:去掉 recurrence 之后,顺序不再天然编码在计算过程里,摊平的 attention 层需要额外把顺序信息补回去,「具体怎么补,下一篇再说」。
上一篇《从 RNN / LSTM / GRU 到早期 Attention》结尾我留了一句话:早期的 attention 并不是为了取代 RNN 而出现的,它只是夹在 encoder–decoder 中间解决 fixed-context bottleneck;但“根据当前需求去读取一组 representation”这种机制,并不一定要依附在 RNN 上。这篇接着讲那个“另一个故事”。