最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
AI 时代,我是如何用 Neovim 掌控多 Agent 协同开发的
最近在折腾多 Agent 协同开发的框架,跑各种脚本的时候发现,平常用的 VS Code 开始变得越来越吃力和累赘。
从局部线性化到 RNN:理解 Jacobian 连乘
·3082 字·7 分钟
最近在重拾一些深度学习基础,发现了一个很有意思的视角。
以前在看 RNN(Recurrent Neural Network)的长距离梯度传播公式时,总能看到一堆 Jacobian 矩阵的连乘,比如 \(\frac{\partial h_T}{\partial h_0} = J_T J_{T-1} \dots J_1\)。
从一次训练集群卡顿,理解 Linux Overcommit
·7453 字·15 分钟
起因 # 最近偶然看到一篇文章,里面提到一个 Linux 和 Windows 的差异:在 Linux 下,即使机器实际上没有足够的物理内存,一个很大的 malloc 仍然可能成功返回。而 Windows 对 committed memory 的管理要严格得多,类似的 allocation 更容易被直接拒绝。
从 Token ID 到 Dense Vector:Embedding 到底在做什么
起因 # 最近在继续 CS336 和 MIT 6.S191。
Next-Token Prediction:语言模型的训练目标从哪来
·3582 字·8 分钟
起因 # 上一篇把 RNN 拆成了两层:state transition 和 output projection。State transition 维护 hidden state,output projection 从 hidden state 中映射出当前任务需要的预测结果。