最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
推荐系统的动态算力:当机器跟不上流量,如何让 Workload 变 Elastic
在 2022 年终总结 里,我曾用几句话带过当时做的一个“动态算力”项目。那一年,我和另一位同事从零到一推进了这套系统,陆续落地了腾讯新闻、QQ 音乐、全民 K 歌等多个核心业务,部分场景节省了约 30% 的成本。
模型压缩之后,为什么推理反而变慢了:一次 CPU Serving 的性能优化实践
·2988 字·6 分钟
之前我负责过一个推荐系统深度学习 Serving 框架的功能开发与性能优化。
我们的系统主要跑在 CPU 上,以 TensorFlow 为主力 inference engine。随着模型迭代,尤其是 Embedding 层越来越大,模型导出、传输和上线变得非常慢,Serving 节点的内存成本也眼看着往上飙。
推荐模型不只是一次 Forward:回看排序模型的 Serving 架构
·1821 字·4 分钟
之前在腾讯做过一个面向推荐场景的深度学习框架(内部叫「无量」),我当时负责其中 Serving 相关的工作。后来和朋友聊起,有人问我:把一个推荐模型部署上线,是不是就是加载模型文件,然后来一个请求做一次 forward?
量化交易不是一个模型:从 Alpha 到执行的完整系统框架
·4294 字·9 分钟
读书时记下的一张系统图 # 2024 年我读过 Rishi K. Narang 的《打开量化投资的黑箱》(Inside the Black Box)。这篇不打算写书评,只提一件事:这本书给了我一张量化交易系统的地图,它把一个典型系统拆成几个组成部分——Alpha Model、Risk Model、Transaction Cost Model、Portfolio Construction Model、Execution Model,底下还有 Data 和 Research。
当资源利用率开始影响 Quota:一次训练集群资源治理机制的设计与反思
·6323 字·13 分钟
起因 # 三年前我参与维护过一个多人共享的训练集群。集群上跑着各业务线的训练任务,用户通过一个队列系统提交,每个用户有自己的资源 Quota。
去掉 RNN 之后,顺序去哪了?
·4722 字·10 分钟
在Self-Attention 那篇里,去掉 recurrence 让不同位置可以并行计算。但顺序原本就编码在这条递推关系里;换成纯 self-attention 后,它由谁来表示?
从 RNN 到 Self-Attention:信息为什么一定要沿着 State 一步步传递?
·6493 字·13 分钟
上一篇《从 RNN / LSTM / GRU 到早期 Attention》结尾我留了一句话:早期的 attention 并不是为了取代 RNN 而出现的,它只是夹在 encoder–decoder 中间解决 fixed-context bottleneck;但“根据当前需求去读取一组 representation”这种机制,并不一定要依附在 RNN 上。这篇接着讲那个“另一个故事”。