Artifact-Bench:AI生成ビデオのアーティファクト検出・評価におけるMLLMの性能評価
Artifact-Benchは、マルチモーダル大規模言語モデル(MLLM)がAI生成ビデオのアーティファクトを検出・分析する能力を体系的に評価するための新しいベンチマークです。フォトリアリスティック、アニメーション、CGスタイルのビデオをカバーする3レベルの階層的分類法を確立し、3つの補完的なタスクを定義しています。19の主要なMLLMを用いた実験では、アーティファクトの知覚と推論に重大な限界があり、多くのモデルが困難な設定でランダムまたはそれ以下の性能を示し、人間の知覚嗜好との間に有意な不一致が見られました。
近年、ビデオ生成モデルの進歩によりAI生成ビデオのリアリズムは大幅に向上しましたが、生成された出力には時間的一貫性の欠如、構造的歪み、意味的不整合などのアーティファクトが依然として存在します。マルチモーダル大規模言語モデル(MLLM)は強力な視覚理解能力を示していますが、こうしたアーティファクトを知覚し推論する能力は不明です。既存のベンチマークは、フォトリアリスティックコンテンツ以外の多様なAI生成ビデオ領域において、アーティファクト認識と詳細な診断推論の体系的な評価を欠いています。このギャップを埋めるために、研究者らはArtifact-Benchを導入しました。これは、AI生成ビデオのアーティファクト検出と分析におけるMLLMの評価のための包括的なベンチマークです。
Artifact-Benchはまず、フォトリアリスティックビデオ、アニメーションビデオ、CGスタイルビデオをカバーする3レベルの階層的リアリズムアーティファクト分類法を確立します。この分類法に基づき、ベンチマークは3つの補完的タスクを定義します:実際のビデオとAI生成ビデオの分類、ペアワイズリアリズム比較、および細粒度アーティファクト識別です。19の主要なMLLMでの実験により、アーティファクトの知覚と推論に重大な限界があることが明らかになり、多くのモデルが困難な設定でランダムまたはそれ以下のパフォーマンスを示しました。さらに、MLLMの判断と人間の知覚嗜好との間に有意な不一致が観察され、AI生成ビデオのリアリズムの一般的評価者としての信頼性が限られていることが浮き彫りになりました。
この研究は、ビデオアーティファクト検出におけるMLLMの能力向上への将来の取り組みに重要な洞察を提供し、人間の知覚によりよく適合する評価手法の開発の必要性を強調しています。