AI News HubLIVE
サイト内リライト2 分で読了

PanoWorld:幾何学的に一貫したパノラマビデオワールドモデリング

PanoWorldは、単一画像とキャプションから幾何学的に一貫した360°ビデオを生成するパノラマビデオワールドモデルです。深度一貫性損失と軌跡一貫性損失により幾何学的制約を強化し、PanoGeoデータセットを導入することで、視覚的リアリズムを維持しつつ幾何学的一貫性を大幅に向上させ、具現化AIの空間理解に貢献します。

ソースarXiv Computer Vision著者: Le Jiang, Xiangyu Bai, Bishoy Galoaa, Shayda Moezzi, Caleb James Lee, Tooba Imtiaz, Edmund Yeh, Jennifer Dy, Yanzhi Wang, Sarah Ostadabbas

最近、ノースイースタン大学の研究チームは、単一画像とテキストキャプションから幾何学的に一貫したパノラマビデオを生成する新しいモデル「PanoWorld」を発表しました。従来のパノラマビデオ生成手法は主に視覚的リアリズムに焦点を当てており、3Dシーンの幾何学的状態を明示的に制約していませんでした。その結果、生成されたビデオでは深度の不整合、対応関係の破綻、不自然な動きが球面上で発生する問題がありました。

PanoWorldは、この問題を解決するために、パノラマビデオ生成を純粋な視覚合成ではなく、幾何学的かつ動的に一貫した潜在状態モデリング問題として捉え直しました。このモデルは、事前学習された透視ビデオワールドモデルを基盤とし、2つの軽量な正則化器を導入しています。1つ目は深度一貫性損失で、疑似正解パノラマ深度を用いて監視します。2つ目は軌跡一貫性損失で、追跡点の3Dワールドフレーム位置を時間的に監視することにより、動きの幾何学的な一貫性を維持します。さらに、条件付けと位置エンコーディングに球面幾何学を考慮した適応を施しています。

研究チームはまた、PanoGeoデータセットを構築しました。これは、多様な実世界および合成ソースから収集された一貫した深度、軌跡、およびプロンプトアノテーションを備えた統合的な幾何学認識パノラマビデオデータセットであり、トレーニングと層別評価の両方に使用されます。実験の結果、PanoWorldは先行手法と比較して幾何学的一貫性を大幅に改善し、競争力のある視覚的リアリズムを維持することが示されました。これにより、パノラマビデオ生成は具現化AIアプリケーションに必要な全体的な空間理解をサポートするために、幾何学的モデリング問題として扱われるべきであることが確立されました。

本研究はLe Jiangら10名の著者によるもので、コードはGitHub(https://github.com/ostadabbas/PanoWorld)で公開されています。論文はarXivに提出され、番号2605.15391が付与されています。