最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
去掉 RNN 之后,顺序去哪了?
·5345 字·11 分钟
上一篇《从 RNN 到 Self-Attention》结尾记账时留了一条:去掉 recurrence 之后,顺序不再天然编码在计算过程里,摊平的 attention 层需要额外把顺序信息补回去,「具体怎么补,下一篇再说」。
从 RNN 到 Self-Attention:信息为什么一定要沿着 State 一步步传递?
·6376 字·13 分钟
上一篇《从 RNN / LSTM / GRU 到早期 Attention》结尾我留了一句话:早期的 attention 并不是为了取代 RNN 而出现的,它只是夹在 encoder–decoder 中间解决 fixed-context bottleneck;但“根据当前需求去读取一组 representation”这种机制,并不一定要依附在 RNN 上。这篇接着讲那个“另一个故事”。
风险也不是一个数字:波动率、最大回撤和 VaR 到底在衡量什么?
上一篇《收益率不是一个数字》最后留下了一句话:同样赚了 10%,一路平稳和先腰斩再翻倍的体验完全不同。我本来以为接下来该看"怎么比较投资"了,结果发现前面还缺一块——先把风险这半边理清楚。
从 RNN / LSTM / GRU 到早期 Attention:为什么“压缩历史”最终变成了“按需读取”
·5735 字·12 分钟
上一篇《从 RNN 到 LSTM,再到 GRU》把 gate 机制理了一遍:LSTM / GRU 把 recurrent state 的信息流变成了可学习的动态控制,决定什么写入、什么保留、什么暴露。写到那里,我以为 RNN 这条线差不多收尾了。
从 RNN 到 LSTM,再到 GRU:循环网络真正改变的是什么?
·3313 字·7 分钟
最近重新复习经典序列模型时,我发现不少资料把重点放在“门(gate)”的数量和复杂公式的罗列上,反而容易忽略这些设计背后的 trade-off。复习的时候,我更想把它们放回 architecture design 的角度看一遍。
把 RNN 沿时间展开之后:理解 BPTT 与梯度传播
最近在重新跟 MIT 6.S191 和 CS336,发现自己处在一个有点尴尬的状态:RNN 的 forward 随时能默写,hidden state 一步一步往前推,没什么好想的。但如果有人接着问"那它到底怎么 backward",我能说出来的只剩几个词——BPTT、沿时间反向传播、梯度消失——再往下就模糊了。