PanoWorld:幾何一致的全景視頻世界建模
PanoWorld是一種全景視頻世界模型,能從單張圖像和描述生成幾何一致的360°視頻。它通過深度一致性損失和軌跡一致性損失增強幾何約束,並引入PanoGeo數據集,在保持視覺真實感的同時顯著提升了幾何一致性,適用於具身AI的空間理解需求。
全景視頻生成是計算機視覺領域的一個重要研究方向,尤其在虛擬現實(VR)和具身人工智能(Embodied AI)中有着廣泛應用。然而,現有的全景視頻生成方法通常只注重視覺真實感,而忽略了對底層3D場景幾何結構的顯式約束。這導致生成的視頻在球面上常常出現深度不一致、對應關係斷裂以及運動不合理等問題,嚴重影響了空間理解的準確性。
針對這一挑戰,來自東北大學(Northeastern University)的研究團隊提出了一種名為PanoWorld的新型全景視頻世界模型。該模型能夠從單張圖像和文本描述中生成幾何一致的全景視頻。研究團隊將這一任務重新定義為幾何與動力學一致的潛在狀態建模問題,而非單純的視覺合成。
PanoWorld基於一個預訓練的透視視頻世界模型,並在此基礎上引入了兩種輕量級正則化器來增強幾何約束。第一種是深度一致性損失,它利用偽真實全景深度作為監督信號,確保生成視頻的深度結構準確。第二種是軌跡一致性損失,它通過追蹤點在世界座標系中的3D位置隨時間變化的軌跡,來約束運動的幾何合理性。此外,研究團隊還對條件輸入和位置編碼進行了球面幾何感知的自適應調整,使得模型能夠更好地適應全景數據的球形拓撲結構。
為了支持模型的訓練和評估,研究者們構建了PanoGeo數據集。這是一個統一的幾何感知全景視頻數據集,包含了來自多種真實環境(如室內場景、城市街景)和合成場景(如虛擬世界)的一致深度、軌跡和提示註釋。該數據集可用於模型的訓練以及分層評估,從而全面衡量幾何一致性和視覺質量。
在實驗中,PanoWorld與現有的多種全景視頻生成方法進行了比較。結果表明,PanoWorld在幾何一致性指標上顯著優於先前的方法,同時保持了具有競爭力的視覺真實感。這一發現表明,全景視頻生成必須被視為一個幾何建模問題,而不是簡單的視覺合成問題。這一認識對於具身AI應用至關重要,因為這類應用需要準確的空間理解能力——例如機器人導航和虛擬環境交互。
該研究由Le Jiang等十位作者共同完成,相關代碼已在GitHub上開源(https://github.com/ostadabbas/PanoWorld)。論文已提交至arXiv預印本平台,編號為2605.15391。這項工作不僅推動了全景視頻生成技術的發展,也為未來幾何感知視覺模型的研發提供了新的方向和基準。