从 AMP 到 Mixed Precision:训练和推理为什么不使用同一种精度Aug 21, 2026·5822 words·12 minsDeep-Learning Mixed-Precision AMP Quantization BF16 Inference Ml-Infra起因 # 以前在商汤做 CV 的时候,有一段时间在做目标检测模型的 INT8 量化。目标很直接:降低 inference latency,减少 model memory 和 bandwidth,同时利用 INT8 hardware throughput。
从 IEEE 754 到 BF16:理解 ML Infra 中的浮点精度选择Aug 19, 2026·6632 words·14 minsDeep-Learning Floating-Point BF16 FP16 TF32 Inference Ml-Infra起因 # 上一篇讨论模型显存时,我直接用了一张表: