·3560 words·8 mins
起因 # 上一篇把 RNN 拆成了两层:state transition 和 output projection。State transition 维护 hidden state,output projection 从 hidden state 中映射出当前任务需要的预测结果。
·8329 words·17 mins
最近在做 Stanford CS336(Language Modeling from Scratch)的 Assignment 1,其中有一个完整的 BPE Tokenizer 实现——从训练到编解码。做完之后,我意识到 BPE 本身并不复杂,更值得琢磨的是它背后的 设计动机和 trade-off——这两点经常被一笔带过。
·5555 words·12 mins
起因 # 机缘使然,最近在工作中接触到了 MoE(Mixture of Experts)。