从 Forward 到 Optimizer:再看一遍 Training Loop2026-09-06·2794 字·6 分钟Deep-Learning Training 反向传播 Optimizer 6.S191 Ml-Infra起因 # 跟 CS336 的作业写到 training loop 的时候,发现自己在 loss.backward() 这行停了一下。
从推理到训练:模型调度中的显存约束2026-09-05·2607 字·6 分钟Deep-Learning Gpu-Memory Model-Scheduling Training Activation-Checkpointing CS336 Ml-Infra推理任务能放下,为什么训练任务放不下 # 上一篇讨论了模型调度中的 Capacity Constraint:一组模型到底能不能同时放进一张 GPU。
从参数量到 Peak Memory:模型显存到底应该怎么算?2026-08-17·5253 字·11 分钟Deep-Learning Gpu-Memory Model-Scheduling Inference Training CS336 Ml-Infra起因 # 上一篇讨论了模型调度中的 Performance Constraint:一个模型放到 GPU 上以后,到底跑多快?