从 Forward 到 Optimizer:再看一遍 Training LoopSep 6, 2026·2713 words·6 minsDeep-Learning Training 反向传播 Optimizer 6.S191 Ml-Infra起因 # CS336 的 training loop 里,loss.backward() 和 optimizer.step() 挨在一起。前者计算 gradient,后者更新 parameter;但 gradient 存在哪里、什么时候清零、optimizer 还维护什么状态,需要分开看。于是结合 MIT 6.S191 的 Lecture 1,把一次训练迭代重新过了一遍。
从推理到训练:模型调度中的显存约束Sep 5, 2026·2607 words·6 minsDeep-Learning Gpu-Memory Model-Scheduling Training Activation-Checkpointing CS336 Ml-Infra推理任务能放下,为什么训练任务放不下 # 上一篇讨论了模型调度中的 Capacity Constraint:一组模型到底能不能同时放进一张 GPU。
从参数量到 Peak Memory:模型显存到底应该怎么算?Aug 17, 2026·5253 words·11 minsDeep-Learning Gpu-Memory Model-Scheduling Inference Training CS336 Ml-Infra起因 # 上一篇讨论了模型调度中的 Performance Constraint:一个模型放到 GPU 上以后,到底跑多快?