儘早檢測,極少升級:從壓縮比特流中實時檢測AI生成視頻
本文提出一種新穎方法,通過分析壓縮比特流而非解碼像素來實時檢測AI生成視頻。該方法利用編解碼器已寫入的運動場數據,實現流式感知,並支持隨時決策。在GenVidBench上,該方法僅用像素CNN五分之一數量級的計算量即達到0.64 AUC,同時通過延遲15%的片段將準確率從0.75提升至0.78,計算量減少7倍。
近年來,AI生成視頻的檢測成為重要課題。傳統方法通常需要將視頻解碼為像素,再通過大型視覺語言模型進行評估,這導致高計算成本和延遲,難以用於實時場景。arXiv於2026年7月發表的最新研究提出了一種顛覆性思路:直接從壓縮比特流中檢測AI生成視頻,無需完全解碼。
該研究由KurbanIntelligenceLab團隊完成,核心思想是將檢測視為流式感知任務。視頻編解碼器在壓縮過程中會生成運動場(motion field),其中包含了幀間差異信息。研究人員發現,直接解析這些運動場數據,而非進行完整的像素域前向傳播,可以大幅降低計算開銷。由於運動場的聚合特徵是單調的,因此只需一個校準閾值即可實現隨時有效的檢測,無需在不同時間點重新校準。
實驗表明,在GenVidBench基準上,僅使用編解碼器階段的檢測方法即可達到0.64的曲線下面積(AUC),而計算量僅為像素域CNN的十萬分之一(即五個數量級的減少),且完全在CPU上運行。該方法的門控機制在數據符合校準分佈時能嚴格控制停止時間的假陽性率,但在分佈偏移下會有所上升。
為進一步提升性能,研究者引入了延遲策略:將15%難以判定的片段提交給更精確(但更昂貴)的後續階段處理。這一策略使得準確率從0.75提升至0.78,同時總計算量反而減少了7倍(配對McNemar檢驗p<10^-6)。階段一排序結果在AIGVDBench上得到復現。
研究者強調,該方法並未引入新的檢測器,其貢獻在於重新定義了問題框架、提供了兩個理論保證以及實測的性能邊界。相關代碼、配置和評估數據集已公開在GitHub上。這一方向為低資源、實時AI視頻檢測開闢了新的可能。