重新思考讀出層:解鎖視頻骨幹網絡用於AI生成視頻檢測
AI生成視頻(AIGV)通常包含幀間不一致導致的細微時間偽影。然而,使用標準全局讀出層的視頻骨幹網絡在AIGV檢測中往往不如強圖像預訓練探測器。本文提出Velocity Gated Patch Velocity Profiling(V-PVP),一種輕量級讀出模塊,僅替換聚合層,增加約0.5M可訓練參數,在AIGVDBench上達到95.28 AUC,且骨幹網絡完全凍結。
人工智能生成的視頻(AIGV)通常包含微妙的時序偽影,這些偽影源於幀間不一致性,而非單幀內部。因此,能夠捕捉此類偽影的檢測器應受益於視頻預訓練骨幹網絡,而非僅圖像預訓練的網絡。然而,在實際應用中,採用標準全局讀出層的視頻骨幹網絡在AIGV基準測試中往往無法超越強大的圖像預訓練探測器。研究人員將這一差距歸因於讀出層中過度的時空聚合。視頻預訓練骨幹網絡傾向於將每一幀壓縮為單一全局描述符,這種壓縮抑制了局部補丁級別的時序動態,並丟棄了補丁間關係,而這正是AIGV檢測最可靠依賴的線索。
基於這一洞察,來自研究機構的團隊提出了Velocity Gated Patch Velocity Profiling(V-PVP),一種輕量級讀出模塊。V-PVP的核心思想是僅替換原有的聚合層,代之以兩個並行流來處理補丁速度場。第一個流通過門控機制選擇對時序變化敏感的補丁,第二個流則對這些補丁的速度分佈進行建模。這種設計使得模塊能夠專注於幀間的局部運動模式,同時避免全局聚合對信息的丟失。整個模塊僅增加約0.5M可訓練參數,因此可以輕鬆集成到任意視頻骨幹網絡中。
實驗結果顯示,V-PVP在多種骨幹網絡(如VideoMAE、TimeSformer、ViViT等)上均能帶來一致的性能提升,無論是在端到端微調還是線性探測設置下。在AIGVDBench基準上,V-PVP達到了95.28 AUC,而骨幹網絡完全保持凍結。這一結果證明了僅通過替換讀出層即可重新激活凍結骨幹網絡的時序潛力,恢復其在AIGV檢測中的優勢。此外,該方法在跨數據集的泛化實驗中同樣表現穩健,表明其對不同生成模型的偽影模式具有魯棒性。
研究的代碼已開源,為後續研究提供了可靠的復現基礎。這項工作不僅為AIGV檢測提供了一種高效的新方案,也提示我們,在許多計算機視覺任務中,讀出層的設計可能是制約模型性能的關鍵瓶頸。未來,V-PVP有望推廣到其他需要時序建模的視頻理解任務中。