最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
重新理解 RNN:Hidden State、Output 和 Prediction 的区别
·3506 字·7 分钟
起因 # 最近在复习 MIT 6.S191 的 RNN 部分,看到 lecture 里画的那张经典展开图时停了一下。
从 Forward 到 Optimizer:再看一遍 Training Loop
·2800 字·6 分钟
起因 # 跟 CS336 的作业写到 training loop 的时候,发现自己在 loss.backward() 这行停了一下。
从推理到训练:模型调度中的显存约束
·2697 字·6 分钟
推理任务能放下,为什么训练任务放不下 # 上一篇讨论了模型调度中的 Capacity Constraint:一组模型到底能不能同时放进一张 GPU。
从 reshape 到 einops:理解 Transformer 代码中的 Tensor Shape DSL
·6463 字·13 分钟
起因 # 最近在做 CS336(Language Modeling from Scratch)的 Transformer 实现,代码里反复出现这种写法:
从线上模型切换问题理解 PyTorch CUDA Caching Allocator:为什么显存管理需要理解生命周期
·7981 字·16 分钟
起因 # 我们的线上推理系统中存在大量模型——MLP、GNN、MoE,以及它们的各种组合。这个 workload 有几个重要特点:
从 DataLoader 到 Remote DataLoader:如何让 GPU 不再等待数据
·5329 字·11 分钟
起因:GPU 没吃满,但不是算力问题 # 最近组里有同学训练模型时,最直接的感受是:GPU utilization 上不去,step time 里总有一段在等数据。