·3582 words·8 mins
起因 # 上一篇把 RNN 拆成了两层:state transition 和 output projection。State transition 维护 hidden state,output projection 从 hidden state 中映射出当前任务需要的预测结果。
·8329 words·17 mins
最近在做 Stanford CS336(Language Modeling from Scratch)的 Assignment 1,其中有一个完整的 BPE Tokenizer 实现——从训练到编解码。做完之后觉得,BPE 这个话题值得好好写一写。不是因为算法本身多复杂,而是它背后的 设计动机和 trade-off 经常被一笔带过。
·5555 words·12 mins
起因 # 机缘使然,最近在工作中接触到了 MoE(Mixture of Experts)。