最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
量化交易不是一个模型:从 Alpha 到执行的完整系统框架
·4436 字·9 分钟
从一个让我愣住的问题说起 # 2024 年我读过 Rishi K. Narang 的《打开量化投资的黑箱》(Inside the Black Box)。这篇不打算写书评,只提一件事:这本书给了我一张量化交易系统的地图,它把一个典型系统拆成几个组成部分——Alpha Model、Risk Model、Transaction Cost Model、Portfolio Construction Model、Execution Model,底下还有 Data 和 Research。
当资源利用率开始影响 Quota:一次训练集群资源治理机制的设计与反思
·6323 字·13 分钟
起因 # 三年前我参与维护过一个多人共享的训练集群。集群上跑着各业务线的训练任务,用户通过一个队列系统提交,每个用户有自己的资源 Quota。
去掉 RNN 之后,顺序去哪了?
·5375 字·11 分钟
上一篇《从 RNN 到 Self-Attention》结尾记账时留了一条:去掉 recurrence 之后,顺序不再天然编码在计算过程里,摊平的 attention 层需要额外把顺序信息补回去,「具体怎么补,下一篇再说」。
从 RNN 到 Self-Attention:信息为什么一定要沿着 State 一步步传递?
·6493 字·13 分钟
上一篇《从 RNN / LSTM / GRU 到早期 Attention》结尾我留了一句话:早期的 attention 并不是为了取代 RNN 而出现的,它只是夹在 encoder–decoder 中间解决 fixed-context bottleneck;但“根据当前需求去读取一组 representation”这种机制,并不一定要依附在 RNN 上。这篇接着讲那个“另一个故事”。
风险也不是一个数字:波动率、最大回撤和 VaR 到底在衡量什么?
上一篇《收益率不是一个数字》最后留下了一句话:同样赚了 10%,一路平稳和先腰斩再翻倍的体验完全不同。我本来以为接下来该看"怎么比较投资"了,结果发现前面还缺一块——先把风险这半边理清楚。
从 RNN / LSTM / GRU 到早期 Attention:为什么“压缩历史”最终变成了“按需读取”
·5735 字·12 分钟
上一篇《从 RNN 到 LSTM,再到 GRU》把 gate 机制理了一遍:LSTM / GRU 把 recurrent state 的信息流变成了可学习的动态控制,决定什么写入、什么保留、什么暴露。写到那里,我以为 RNN 这条线差不多收尾了。