从 Forward 到 Optimizer:再看一遍 Training Loop2026-09-06·2713 字·6 分钟Deep-Learning Training 反向传播 Optimizer 6.S191 Ml-Infra起因 # CS336 的 training loop 里,loss.backward() 和 optimizer.step() 挨在一起。前者计算 gradient,后者更新 parameter;但 gradient 存在哪里、什么时候清零、optimizer 还维护什么状态,需要分开看。于是结合 MIT 6.S191 的 Lecture 1,把一次训练迭代重新过了一遍。
从推理到训练:模型调度中的显存约束2026-09-05·2607 字·6 分钟Deep-Learning Gpu-Memory Model-Scheduling Training Activation-Checkpointing CS336 Ml-Infra推理任务能放下,为什么训练任务放不下 # 上一篇讨论了模型调度中的 Capacity Constraint:一组模型到底能不能同时放进一张 GPU。
从参数量到 Peak Memory:模型显存到底应该怎么算?2026-08-17·5253 字·11 分钟Deep-Learning Gpu-Memory Model-Scheduling Inference Training CS336 Ml-Infra起因 # 上一篇讨论了模型调度中的 Performance Constraint:一个模型放到 GPU 上以后,到底跑多快?