模型压缩之后,为什么推理反而变慢了:一次 CPU Serving 的性能优化实践2026-09-15·2988 字·6 分钟工程 Serving Performance-Engineering SIMD之前我负责过一个推荐系统深度学习 Serving 框架的功能开发与性能优化。 我们的系统主要跑在 CPU 上,以 TensorFlow 为主力 inference engine。随着模型迭代,尤其是 Embedding 层越来越大,模型导出、传输和上线变得非常慢,Serving 节点的内存成本也眼看着往上飙。
一次 AVX2 在 GCC 4 上 Core Dump 的排查经历2021-07-22·1157 字·3 分钟工程 SIMD AVX 性能优化从最小复现、指令集与 ABI 差异入手,定位旧版 GCC 环境中的 AVX2 崩溃问题。