AI News HubLIVE
站内改写1 分钟阅读

重新思考读出层:解锁视频骨干网络用于AI生成视频检测

AI生成视频(AIGV)通常包含帧间不一致导致的细微时间伪影。然而,使用标准全局读出层的视频骨干网络在AIGV检测中往往不如强图像预训练探测器。本文提出Velocity Gated Patch Velocity Profiling(V-PVP),一种轻量级读出模块,仅替换聚合层,增加约0.5M可训练参数,在AIGVDBench上达到95.28 AUC,且骨干网络完全冻结。

来源arXiv Computer Vision作者: Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhenyu Zhang

人工智能生成的视频(AIGV)通常包含微妙的时序伪影,这些伪影源于帧间不一致性,而非单帧内部。因此,能够捕捉此类伪影的检测器应受益于视频预训练骨干网络,而非仅图像预训练的网络。然而,在实际应用中,采用标准全局读出层的视频骨干网络在AIGV基准测试中往往无法超越强大的图像预训练探测器。研究人员将这一差距归因于读出层中过度的时空聚合。视频预训练骨干网络倾向于将每一帧压缩为单一全局描述符,这种压缩抑制了局部补丁级别的时序动态,并丢弃了补丁间关系,而这正是AIGV检测最可靠依赖的线索。

基于这一洞察,来自研究机构的团队提出了Velocity Gated Patch Velocity Profiling(V-PVP),一种轻量级读出模块。V-PVP的核心思想是仅替换原有的聚合层,代之以两个并行流来处理补丁速度场。第一个流通过门控机制选择对时序变化敏感的补丁,第二个流则对这些补丁的速度分布进行建模。这种设计使得模块能够专注于帧间的局部运动模式,同时避免全局聚合对信息的丢失。整个模块仅增加约0.5M可训练参数,因此可以轻松集成到任意视频骨干网络中。

实验结果显示,V-PVP在多种骨干网络(如VideoMAE、TimeSformer、ViViT等)上均能带来一致的性能提升,无论是在端到端微调还是线性探测设置下。在AIGVDBench基准上,V-PVP达到了95.28 AUC,而骨干网络完全保持冻结。这一结果证明了仅通过替换读出层即可重新激活冻结骨干网络的时序潜力,恢复其在AIGV检测中的优势。此外,该方法在跨数据集的泛化实验中同样表现稳健,表明其对不同生成模型的伪影模式具有鲁棒性。

研究的代码已开源,为后续研究提供了可靠的复现基础。这项工作不仅为AIGV检测提供了一种高效的新方案,也提示我们,在许多计算机视觉任务中,读出层的设计可能是制约模型性能的关键瓶颈。未来,V-PVP有望推广到其他需要时序建模的视频理解任务中。