从推理到训练:模型调度中的显存约束2026-09-05·2607 字·6 分钟Deep-Learning Gpu-Memory Model-Scheduling Training Activation-Checkpointing CS336 Ml-Infra推理任务能放下,为什么训练任务放不下 # 上一篇讨论了模型调度中的 Capacity Constraint:一组模型到底能不能同时放进一张 GPU。
从线上模型切换问题理解 PyTorch CUDA Caching Allocator:为什么显存管理需要理解生命周期2026-08-26·7513 字·15 分钟Deep-Learning CUDA PyTorch Gpu-Memory Memory-Allocator Inference Ml-Infra起因 # 我们的线上推理系统中存在大量模型——MLP、GNN、MoE,以及它们的各种组合。这个 workload 有几个重要特点:
从参数量到 Peak Memory:模型显存到底应该怎么算?2026-08-17·5253 字·11 分钟Deep-Learning Gpu-Memory Model-Scheduling Inference Training CS336 Ml-Infra起因 # 上一篇讨论了模型调度中的 Performance Constraint:一个模型放到 GPU 上以后,到底跑多快?