尽早检测,极少升级:从压缩比特流中实时检测AI生成视频
本文提出一种新颖方法,通过分析压缩比特流而非解码像素来实时检测AI生成视频。该方法利用编解码器已写入的运动场数据,实现流式感知,并支持随时决策。在GenVidBench上,该方法仅用像素CNN五分之一数量级的计算量即达到0.64 AUC,同时通过延迟15%的片段将准确率从0.75提升至0.78,计算量减少7倍。
近年来,AI生成视频的检测成为重要课题。传统方法通常需要将视频解码为像素,再通过大型视觉语言模型进行评估,这导致高计算成本和延迟,难以用于实时场景。arXiv于2026年7月发表的最新研究提出了一种颠覆性思路:直接从压缩比特流中检测AI生成视频,无需完全解码。
该研究由KurbanIntelligenceLab团队完成,核心思想是将检测视为流式感知任务。视频编解码器在压缩过程中会生成运动场(motion field),其中包含了帧间差异信息。研究人员发现,直接解析这些运动场数据,而非进行完整的像素域前向传播,可以大幅降低计算开销。由于运动场的聚合特征是单调的,因此只需一个校准阈值即可实现随时有效的检测,无需在不同时间点重新校准。
实验表明,在GenVidBench基准上,仅使用编解码器阶段的检测方法即可达到0.64的曲线下面积(AUC),而计算量仅为像素域CNN的十万分之一(即五个数量级的减少),且完全在CPU上运行。该方法的门控机制在数据符合校准分布时能严格控制停止时间的假阳性率,但在分布偏移下会有所上升。
为进一步提升性能,研究者引入了延迟策略:将15%难以判定的片段提交给更精确(但更昂贵)的后续阶段处理。这一策略使得准确率从0.75提升至0.78,同时总计算量反而减少了7倍(配对McNemar检验p<10^-6)。阶段一排序结果在AIGVDBench上得到复现。
研究者强调,该方法并未引入新的检测器,其贡献在于重新定义了问题框架、提供了两个理论保证以及实测的性能边界。相关代码、配置和评估数据集已公开在GitHub上。这一方向为低资源、实时AI视频检测开辟了新的可能。