模型压缩之后,为什么推理反而变慢了:一次 CPU Serving 的性能优化实践2026-09-15·3007 字·7 分钟工程 Serving Performance-Engineering SIMD之前我负责过一个推荐系统深度学习 Serving 框架的功能开发与性能优化。 我们的系统主要跑在 CPU 上,以 TensorFlow 为主力 inference engine。随着模型迭代,尤其是 Embedding 层越来越大,模型导出、传输和上线变得非常慢,Serving 节点的内存成本也眼看着往上飙。