AI News HubLIVE
站內改寫1 分鐘閱讀

重新思考讀出層:解鎖影片骨幹網路用於AI生成影片檢測

AI生成影片(AIGV)通常包含幀間不一致導致的細微時間偽影。然而,使用標準全域性讀出層的影片骨幹網路在AIGV檢測中往往不如強影像預訓練探測器。本文提出Velocity Gated Patch Velocity Profiling(V-PVP),一種輕量級讀出模組,僅替換聚合層,增加約0.5M可訓練引數,在AIGVDBench上達到95.28 AUC,且骨幹網路完全凍結。

來源arXiv Computer Vision作者: Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhenyu Zhang

人工智慧生成的影片(AIGV)通常包含微妙的時序偽影,這些偽影源於幀間不一致性,而非單幀內部。因此,能夠捕捉此類偽影的檢測器應受益於影片預訓練骨幹網路,而非僅影像預訓練的網路。然而,在實際應用中,採用標準全域性讀出層的影片骨幹網路在AIGV基準測試中往往無法超越強大的影像預訓練探測器。研究人員將這一差距歸因於讀出層中過度的時空聚合。影片預訓練骨幹網路傾向於將每一幀壓縮為單一全域性描述符,這種壓縮抑制了區域性補丁級別的時序動態,並丟棄了補丁間關係,而這正是AIGV檢測最可靠依賴的線索。

基於這一洞察,來自研究機構的團隊提出了Velocity Gated Patch Velocity Profiling(V-PVP),一種輕量級讀出模組。V-PVP的核心思想是僅替換原有的聚合層,代之以兩個並行流來處理補丁速度場。第一個流透過門控機制選擇對時序變化敏感的補丁,第二個流則對這些補丁的速度分佈進行建模。這種設計使得模組能夠專注於幀間的區域性運動模式,同時避免全域性聚合對資訊的丟失。整個模組僅增加約0.5M可訓練引數,因此可以輕鬆整合到任意影片骨幹網路中。

實驗結果顯示,V-PVP在多種骨幹網路(如VideoMAE、TimeSformer、ViViT等)上均能帶來一致的效能提升,無論是在端到端微調還是線性探測設定下。在AIGVDBench基準上,V-PVP達到了95.28 AUC,而骨幹網路完全保持凍結。這一結果證明了僅透過替換讀出層即可重新啟用凍結骨幹網路的時序潛力,恢復其在AIGV檢測中的優勢。此外,該方法在跨資料集的泛化實驗中同樣表現穩健,表明其對不同生成模型的偽影模式具有魯棒性。

研究的程式碼已開源,為後續研究提供了可靠的復現基礎。這項工作不僅為AIGV檢測提供了一種高效的新方案,也提示我們,在許多計算機視覺任務中,讀出層的設計可能是制約模型效能的關鍵瓶頸。未來,V-PVP有望推廣到其他需要時序建模的影片理解任務中。