最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
VAE 为什么要让 Latent Variable 变成一个概率分布
·6201 字·13 分钟
起因 # 上一篇文章理清了 latent variable 和 latent space 的概念,最后停在一个地方:
从特征表示到生成语义:深入理解 Latent Variable 与 Latent Space
·7071 字·15 分钟
起因 # 最近在看 MIT 6.S191 Lecture 4——Generative Modeling。在这之前我对生成模型基本没什么了解,刚建立了一个很粗的认知:
从 Faster R-CNN 到 Anchor-Free:经典目标检测架构到底在解决什么问题
以前在商汤做 CV 的时候,Faster R-CNN、SSD、FPN、RetinaNet 这些名字是天天打交道的。模型训练、转换、部署,各种坑也踩了不少——TensorRT 版本间 softmax axis 默认值不一致、RoI Align 的 num_roi_per_image 默认 300 导致多 batch 结果错乱,这类问题当年 debug 到怀疑人生。
视频不等于视频模型:从抽帧 2D CNN 到 Conv3D 的选择逻辑
·4816 字·10 分钟
以前做 CV 内容审核的时候,训练数据里有大量视频。色情视频审核是一个很典型的场景——输入是一段几十秒甚至几分钟的视频,输出是一个二分类:这段视频是否包含色情内容。
9 年后重温 CNN:剥掉算子细节后,真正留下了什么
·5891 字·12 分钟
最近在重新过 MIT 6.S191 Lecture 3(卷积神经网络)。2017 年刚接触 CV 那会儿,CNN 算是吃饭的家伙,每天都在调。后来精力逐渐转到 ML Infra,成天跟 GPU 显存、通信拓扑和算子优化打交道,卷积网络的很多具体细节就慢慢生疏了——写个 nn.Conv2d 时 weight 的四维形状到底怎么排、Kaiming 初始化的方差怎么推、感受野怎么算,冷不丁被问到,还得在脑子里卡壳一下。
Attention 之后还缺什么:从 Residual Connection 到 Transformer Stack
·5963 字·12 分钟
上一篇结尾我写:Multi-Head Attention 仍然只是一个 information routing / read mechanism,一个完整的 Transformer layer 还包含 FFN、residual connection、layer normalization 等组件。
从标量整数到相对几何:Sinusoidal Positional Encoding 到底在设计什么?
·7042 字·15 分钟
上一篇走到了一个结论:去掉 recurrence 之后,Self-Attention 必须重新获得 positional information。position 可以加进 token 的 representation,两者相加不要求后续计算无损还原,只要下游能利用其中的信息就行。