Next-Token Prediction:语言模型的训练目标从哪来Sep 8, 2026·3729 words·8 minsDeep-Learning RNN LLM Probability 6.S191起因 # 上一篇把 RNN 拆成了两层:state transition 和 output projection。State transition 维护 hidden state,output projection 从 hidden state 中映射出当前任务需要的预测结果。