SAGA:生成AI動画のソース帰属(使用モデルの特定)
SAGA(生成AI動画のソース帰属)は、特定の生成AI動画を生み出したモデルを特定する初の大規模フレームワークです。真偽の二値判定を超え、真正性、生成タスク(T2V/I2V)、モデルバージョン、開発チーム、正確な生成器の5段階で帰属を提供します。新しいビデオトランスフォーマーアーキテクチャとデータ効率的な事前学習・帰属戦略により、クラスあたり0.5%のラベルデータで最先端性能を達成し、時間的注意シグネチャ(T-Sigs)で解釈可能性を実現します。
生成AI技術の急速な進展により、超現実的な合成動画が大量に生成され、悪用のリスクが高まっています。従来の真偽判定検出器では対応が難しくなっており、研究チームはSAGA(Source Attribution of Generative AI videos)を提案しました。これは、AI生成動画のソース帰属を大規模に行う初の包括的フレームワークです。SAGAは動画がAI生成かどうかを判断するだけでなく、それを生成した特定のモデルを特定します。
SAGAの革新性は、多粒度の帰属を提供する点にあります。真正性(真偽)、生成タスク(テキストから動画T2V、画像から動画I2V)、モデルバージョン、開発チーム、そして正確な生成器の5段階で分類します。この詳細な分類は、従来の単純な判定よりもはるかに豊かなフォレンジック情報を提供します。技術的には、SAGAは新しいビデオトランスフォーマーアーキテクチャを採用し、強力な視覚基盤モデルの特徴を活用することで、時空間アーティファクトを効果的に捉えます。
重要なのは、SAGAがデータ効率的な「事前学習-帰属」戦略を導入したことです。実験では、クラスあたりわずか0.5%のラベルデータで、完全教師あり学習と同等の帰属性能を達成しました。これにより、大規模なラベルデータへの依存が大幅に低減されます。さらに、研究チームは時間的注意シグネチャ(Temporal Attention Signatures、T-Sigs)を提案しました。これは学習された時間的差異を可視化する新しい解釈可能性手法で、なぜ異なる動画生成器が区別可能なのかを初めて説明します。
公開データセットを用いた広範な実験(クロスドメインシナリオを含む)により、SAGAは合成動画のソース特定において新たなベンチマークを確立しました。この研究は、動画フォレンジック、コンテンツモデレーション、AI規制に不可欠な解釈可能なツールを提供し、重要な実用的価値を持ちます。