从 Forward 到 Optimizer:再看一遍 Training Loop2026-09-06·2713 字·6 分钟Deep-Learning Training 反向传播 Optimizer 6.S191 Ml-Infra起因 # CS336 的 training loop 里,loss.backward() 和 optimizer.step() 挨在一起。前者计算 gradient,后者更新 parameter;但 gradient 存在哪里、什么时候清零、optimizer 还维护什么状态,需要分开看。于是结合 MIT 6.S191 的 Lecture 1,把一次训练迭代重新过了一遍。