从标量整数到相对几何:Sinusoidal Positional Encoding 到底在设计什么?2026-09-19·7042 字·15 分钟Deep-Learning Positional-Encoding Transformer Sinusoidal 6.S191上一篇走到了一个结论:去掉 recurrence 之后,Self-Attention 必须重新获得 positional information。position 可以加进 token 的 representation,两者相加不要求后续计算无损还原,只要下游能利用其中的信息就行。
去掉 RNN 之后,顺序去哪了?2026-09-13·4658 字·10 分钟Deep-Learning RNN Self-Attention Positional-Encoding 6.S191在Self-Attention 那篇里,去掉 recurrence 让不同位置可以并行计算。但顺序原本就编码在这条递推关系里;换成纯 self-attention 后,它由谁来表示?