模型压缩之后,为什么推理反而变慢了:一次 CPU Serving 的性能优化实践Sep 15, 2026·3007 words·7 mins工程 Serving Performance-Engineering SIMD之前我负责过一个推荐系统深度学习 Serving 框架的功能开发与性能优化。 我们的系统主要跑在 CPU 上,以 TensorFlow 为主力 inference engine。随着模型迭代,尤其是 Embedding 层越来越大,模型导出、传输和上线变得非常慢,Serving 节点的内存成本也眼看着往上飙。
推荐模型不只是一次 Forward:回看排序模型的 Serving 架构Sep 15, 2026·1821 words·4 minsDeep-Learning 推荐系统 Serving TensorFlow RPC之前在腾讯做过一个面向推荐场景的深度学习框架(内部叫「无量」),我当时负责其中 Serving 相关的工作。后来和朋友聊起,有人问我:把一个推荐模型部署上线,是不是就是加载模型文件,然后来一个请求做一次 forward?