最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
从倒排索引到 BPE:高性能系统为什么总在避免扫描全集
最近在系统学习 Search 和 Information Retrieval 的知识。在看倒排索引(Inverted Index)的时候,我越看越觉得这个结构非常眼熟。直到我想起前段时间写 CS336 作业里 BPE(Byte-Pair Encoding)分词算法的优化逻辑,我才突然意识到:原来这些看似完全不同领域的系统,底层其实都在共享同一种 pattern。
推荐系统的动态算力:当机器跟不上流量,如何让 Workload 具备弹性
在 2022 年的年终总结里,我提过当时做的一个“动态算力”项目。那一年,我和另一位同事一起推进了这套系统,陆续接入腾讯新闻、QQ 音乐、全民 K 歌等业务,部分场景节省了约 30% 的成本。
模型压缩之后,为什么推理反而变慢了:一次 CPU Serving 的性能优化实践
·2821 字·6 分钟
之前我负责过一个推荐系统深度学习 Serving 框架的功能开发与性能优化。
我们的系统主要跑在 CPU 上,以 TensorFlow 为主力 inference engine。随着模型迭代,尤其是 Embedding 层越来越大,模型导出、传输和上线变得非常慢,Serving 节点的内存成本也眼看着往上飙。
推荐模型不只是一次 Forward:回看排序模型的 Serving 架构
·1572 字·4 分钟
之前在腾讯做过一个面向推荐场景的深度学习框架(内部叫「无量」),我当时负责其中 Serving 相关的工作。后来和朋友聊起,有人问我:把一个推荐模型部署上线,是不是就是加载模型文件,然后来一个请求做一次 forward?
量化交易不是一个模型:从 Alpha 到执行的完整系统框架
·4260 字·9 分钟
读书时记下的一张系统图 # 2024 年我读过 Rishi K. Narang 的《打开量化投资的黑箱》(Inside the Black Box)。书里把一个典型的量化交易系统拆成几个组成部分——Alpha Model、Risk Model、Transaction Cost Model、Portfolio Construction Model、Execution Model,底下还有 Data 和 Research。
当资源利用率开始影响 Quota:一次训练集群资源治理机制的设计与反思
·6323 字·13 分钟
起因 # 三年前我参与维护过一个多人共享的训练集群。集群上跑着各业务线的训练任务,用户通过一个队列系统提交,每个用户有自己的资源 Quota。
去掉 RNN 之后,顺序去哪了?
·4658 字·10 分钟
在Self-Attention 那篇里,去掉 recurrence 让不同位置可以并行计算。但顺序原本就编码在这条递推关系里;换成纯 self-attention 后,它由谁来表示?
从 RNN 到 Self-Attention:信息为什么一定要沿着 State 一步步传递?
·6495 字·13 分钟
上一篇《从 RNN / LSTM / GRU 到早期 Attention》结尾我留了一句话:早期的 attention 并不是为了取代 RNN 而出现的,它只是夹在 encoder–decoder 中间解决 fixed-context bottleneck;但“根据当前需求去读取一组 representation”这种机制,并不一定要依附在 RNN 上。这篇接着讲那个“另一个故事”。