视频不等于视频模型:从抽帧 2D CNN 到 Conv3D 的选择逻辑2026-09-20·4816 字·10 分钟Deep-Learning CNN Conv3D Video-Understanding Temporal-Modeling以前做 CV 内容审核的时候,训练数据里有大量视频。色情视频审核是一个很典型的场景——输入是一段几十秒甚至几分钟的视频,输出是一个二分类:这段视频是否包含色情内容。 但最近回忆起那段经历,我发现一件当时觉得理所当然、现在重新想却很有意思的事:虽然输入是视频,当时实际的做法却是先抽帧,把视频拆成若干张图片,然后按照普通的图片分类问题来做。