视频不等于视频模型:从抽帧 2D CNN 到 Conv3D 的选择逻辑Sep 20, 2026·4816 words·10 minsDeep-Learning CNN Conv3D Video-Understanding Temporal-Modeling以前做 CV 内容审核的时候,训练数据里有大量视频。色情视频审核是一个很典型的场景——输入是一段几十秒甚至几分钟的视频,输出是一个二分类:这段视频是否包含色情内容。 但最近回忆起那段经历,我发现一件当时觉得理所当然、现在重新想却很有意思的事:虽然输入是视频,当时实际的做法却是先抽帧,把视频拆成若干张图片,然后按照普通的图片分类问题来做。