Next-Token Prediction:语言模型的训练目标从哪来2026-09-08·3560 字·8 分钟Deep-Learning RNN LLM 概率 6.S191起因 # 上一篇把 RNN 拆成了两层:state transition 和 output projection。State transition 维护 hidden state,output projection 从 hidden state 中映射出当前任务需要的预测结果。
从 Bytes 到 Tokens:我在 CS336 中实现 BPE Tokenizer2026-08-23·8329 字·17 分钟Mooc CS336 Tokenizer BPE NLP LLM最近在做 Stanford CS336(Language Modeling from Scratch)的 Assignment 1,其中有一个完整的 BPE Tokenizer 实现——从训练到编解码。做完之后,我意识到 BPE 本身并不复杂,更值得琢磨的是它背后的 设计动机和 trade-off——这两点经常被一笔带过。
MoE 结构学习笔记:Expert 与 Gate 的几种关系2026-08-09·5555 字·12 分钟Deep-Learning MoE LLM起因 # 机缘使然,最近在工作中接触到了 MoE(Mixture of Experts)。