動画生成モデルは、一見滑らかで自然な映像を生成できるようになったが、「視覚的に自然」であることと「物理的に正しい」ことは別問題だ。また、従来のスカラー品質スコアは、どの物理的制約に違反したか、あるいはどこで失敗したかを示すことができない。この問題に対処するため、arXiv に発表された新しい研究は VeriPhy を提案している。これは、ワールドモデルを評価・改良するための、監査可能な物理検証システムである。
VeriPhy の基本的な流れは次のとおりだ。まず、テキストのみのプランナーが、ビデオのフレームを観測する前に、プロンプトを型付きの物理的義務へとコンパイルし、静的に検証された実行計画を生成する。実行時には、観測結果に応じて、凍結された低レベル専門ツールの呼び出しだけがゲートされる。具体的には、セグメンテーションと追跡、計数、追跡結果に対する11種類の型付き物理計測、深度推定、OCR、音声イベント検出などが含まれる。各アクションは provenance(来歴)を持つ証拠記録を返し、そのペイロードは、利用可能であれば型付き計測値か、明示的にタグ付けされた学習状態のいずれかになる。型付きリゾルバと固定の合成ルールは、こうした記録を supported(支持)、contradicted(矛盾)、unknown(不明)の三値状態に写像し、それぞれ plausible(もっともらしい)、implausible(疑わしい)、abstain(棄権)として提示する。そのため、すべての判定は、どの証拠に基づいて下されたかを遡って確認できる。
評価では、1,500クリップからなる人間による注釈付きコーパスが構築された。欠陥記録は、プロンプト参照、空間、時間における実際の生成失敗を特定する。このうち149クリップ・304件の欠陥記録からなる中核セットでは、VeriPhy が228件を説明できた。同じクリップと主張に対して公開された質問分解型評価器は164件にとどまる。一方、同一のバックボーンをモノリシックにプロンプトする方法も222件に達しており、単純な再現率では VeriPhy を明確に区別できない。違いは、各判定が証拠記録と来歴を保持していること、つまり判定単位で監査可能であり、批評者の判定を生成側に書き戻すためのインターフェースとして使える点にある。
この研究の貢献は、映像コンテンツに「点数」を付けるだけでなく、物理的な検証を型付きサブタスクに分解し、証拠チェーンでつなぐ監査可能な中間層を示したことにある。VeriPhy のような仕組みは、生成モデルが自身の欠点を理解し、外部の検証結果を利用してターゲットを絞った修正を行うための基盤となるだろう。