リードアウトの再考:AI生成動画検出のためのビデオバックボーンの活用
AI生成動画(AIGV)はフレーム間の不整合による微妙な時間的アーティファクトを含む。しかし、標準的なグローバルリードアウトを用いるビデオバックボーンは、局所パッチの時間ダイナミクスを抑制し、検出を妨げる。提案手法V-PVPは、パッチ速度場上の並列ストリームで集約層を置き換える軽量リードアウトで、約0.5Mパラメータを追加し、バックボーンを凍結したままAIGVDBenchで95.28 AUCを達成。
AI生成動画(AIGV)は通常、フレーム間の不整合から生じる微妙な時間的アーティファクトを含んでいます。したがって、そのようなアーティファクトを捉える検出器は、画像のみのバックボーンよりもビデオ事前学習バックボーンから恩恵を受けるはずです。しかし実際には、標準的なグローバルリードアウトを用いるビデオバックボーンは、AIGVベンチマークにおいて強力な画像事前学習プローブを上回ることができません。研究者らはこのギャップを、リードアウトにおける過度な時空間集約に起因すると考えています。ビデオ事前学習バックボーンは各フレームを単一のグローバル記述子に圧縮する傾向があり、この圧縮によって局所パッチレベルの時間ダイナミクスが抑制され、パッチ間関係が破棄されます。これらはまさにAIGV検出が最も確実に依存する手がかりです。
この洞察に基づき、研究チームはVelocity Gated Patch Velocity Profiling(V-PVP)を提案しました。V-PVPは、既存の集約層を2つの並列ストリームで置き換える軽量リードアウトモジュールです。第1のストリームは時間的変化に敏感なパッチを選択するゲーティング機構を持ち、第2のストリームはこれらのパッチの速度分布をモデル化します。この設計により、フレーム間の局所的な動きパターンに焦点を当てつつ、グローバル集約による情報損失を回避します。追加されるトレーニング可能パラメータは約0.5Mとわずかであり、任意のビデオバックボーンに容易に組み込むことができます。
実験では、V-PVPはVideoMAE、TimeSformer、ViViTなど多様なバックボーンに対し、エンドツーエンドのファインチューニングと線形プロービングの両方の設定で一貫した性能向上を示しました。AIGVDBenchにおいて、バックボーンを完全に凍結した状態で95.28 AUCを達成し、集約層の単純な置き換えが凍結されたビデオバックボーンの時間的ポテンシャルを再活性化し、AIGV検出における優位性を回復することを実証しました。さらに、異なるデータセットに対する汎化実験でも頑健性を示し、様々な生成モデルのアーティファクトパターンに対応できることが確認されました。
コードは公開されており、再現可能な研究基盤を提供しています。本研究はAIGV検出の効率的な新手法を示すだけでなく、多くのコンピュータビジョンタスクにおいてリードアウト層の設計がモデル性能の重要なボトルネックになり得ることを示唆しています。将来的には、V-PVPは時系列モデリングが必要な他のビデオ理解タスクにも応用されることが期待されます。