AI News HubLIVE
サイト内リライト2 分で読了

早期に検出、稀にエスカレーション:圧縮ビットストリームからのAI生成ビデオの随時検出

本論文は、ピクセルにデコードする代わりに圧縮ビットストリームを分析することで、AI生成ビデオをリアルタイムで検出する新しいアプローチを提案します。コーデックがすでに書き込んだモーションフィールドを利用したストリーミング知覚フレームワークを導入し、単一の調整済み閾値で随時検出を可能にします。この手法はGenVidBenchで0.64のAUCを達成し、ピクセルベースCNNよりも5桁少ない計算量で動作し、15%のクリップを延期することで精度を0.75から0.78に向上させ、計算量を7倍削減します。

ソースarXiv Computer Vision著者: Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

近年、AI生成ビデオの検出は重要な課題となっています。従来の手法は通常、ビデオをピクセルにデコードし、大規模な視覚言語モデルで評価するため、計算コストと遅延が大きく、リアルタイムでの利用は困難でした。2026年7月にarXivで発表された最新の研究は、圧縮ビットストリームから直接AI生成ビデオを検出するという革新的なアイデアを提案しています。

この研究はKurbanIntelligenceLabチームによるもので、核心は検出をストリーミング知覚タスクとして捉えることです。ビデオコーデックは圧縮過程でモーションフィールドを生成し、これにはフレーム間の差分情報が含まれています。研究者らは、これらのモーションフィールドデータを直接解析することで、完全なピクセル領域の順伝搬を行うよりも大幅に計算量を削減できることを発見しました。モーションフィールドの集約特性が単調であるため、単一の調整済み閾値で随時有効な検出が可能であり、異なる時点で再調整する必要はありません。

実験では、GenVidBenchベンチマークにおいて、コーデック段のみの検出手法で0.64のAUCを達成し、計算量はピクセル領域CNNの10万分の1(5桁削減)で、すべてCPU上で動作しました。この手法のゲート機構は、データが較正分布に合致する場合に停止時間の偽陽性率を厳密に制御しますが、分布シフトが生じると上昇します。

性能をさらに向上させるため、研究者らは延期戦略を導入しました。判定が難しい15%のクリップをより正確(ただし高コスト)な後続段階に回すことで、精度が0.75から0.78に向上し、総計算量は逆に7倍削減されました(ペアのMcNemar検定p<10^-6)。段階1の順序付け結果はAIGVDBenchでも再現されました。

研究者らは、この手法が新しい検出器を導入するものではなく、問題の枠組みの再定義、2つの理論的保証、および実測された性能境界を貢献として強調しています。関連コード、設定、評価データセットはGitHubで公開されています。この方向性は、低リソースでリアルタイムなAIビデオ検出に新たな可能性を開くものです。