Next-Token Prediction:语言模型的训练目标从哪来2026-09-08·3560 字·8 分钟Deep-Learning RNN LLM 概率 6.S191起因 # 上一篇把 RNN 拆成了两层:state transition 和 output projection。State transition 维护 hidden state,output projection 从 hidden state 中映射出当前任务需要的预测结果。
从 Bytes 到 Tokens:我在 CS336 中实现 BPE Tokenizer2026-08-23·8149 字·17 分钟Mooc CS336 Tokenizer BPE NLP LLM最近在做 Stanford CS336(Language Modeling from Scratch)的 Assignment 1,实现了一个 BPE Tokenizer。最初的 trainer 跑 TinyStories 要约 8 分钟,改完后降到约 36 秒。
MoE 结构学习笔记:Expert 与 Gate 的几种关系2026-08-09·5555 字·12 分钟Deep-Learning MoE LLM起因 # 机缘使然,最近在工作中接触到了 MoE(Mixture of Experts)。