AI News HubLIVE
站内改写2 分钟阅读

PanoWorld:几何一致的全景视频世界建模

PanoWorld是一种全景视频世界模型,能从单张图像和描述生成几何一致的360°视频。它通过深度一致性损失和轨迹一致性损失增强几何约束,并引入PanoGeo数据集,在保持视觉真实感的同时显著提升了几何一致性,适用于具身AI的空间理解需求。

来源arXiv Computer Vision作者: Le Jiang, Xiangyu Bai, Bishoy Galoaa, Shayda Moezzi, Caleb James Lee, Tooba Imtiaz, Edmund Yeh, Jennifer Dy, Yanzhi Wang, Sarah Ostadabbas

全景视频生成是计算机视觉领域的一个重要研究方向,尤其在虚拟现实(VR)和具身人工智能(Embodied AI)中有着广泛应用。然而,现有的全景视频生成方法通常只注重视觉真实感,而忽略了对底层3D场景几何结构的显式约束。这导致生成的视频在球面上常常出现深度不一致、对应关系断裂以及运动不合理等问题,严重影响了空间理解的准确性。

针对这一挑战,来自东北大学(Northeastern University)的研究团队提出了一种名为PanoWorld的新型全景视频世界模型。该模型能够从单张图像和文本描述中生成几何一致的全景视频。研究团队将这一任务重新定义为几何与动力学一致的潜在状态建模问题,而非单纯的视觉合成。

PanoWorld基于一个预训练的透视视频世界模型,并在此基础上引入了两种轻量级正则化器来增强几何约束。第一种是深度一致性损失,它利用伪真实全景深度作为监督信号,确保生成视频的深度结构准确。第二种是轨迹一致性损失,它通过追踪点在世界坐标系中的3D位置随时间变化的轨迹,来约束运动的几何合理性。此外,研究团队还对条件输入和位置编码进行了球面几何感知的自适应调整,使得模型能够更好地适应全景数据的球形拓扑结构。

为了支持模型的训练和评估,研究者们构建了PanoGeo数据集。这是一个统一的几何感知全景视频数据集,包含了来自多种真实环境(如室内场景、城市街景)和合成场景(如虚拟世界)的一致深度、轨迹和提示注释。该数据集可用于模型的训练以及分层评估,从而全面衡量几何一致性和视觉质量。

在实验中,PanoWorld与现有的多种全景视频生成方法进行了比较。结果表明,PanoWorld在几何一致性指标上显著优于先前的方法,同时保持了具有竞争力的视觉真实感。这一发现表明,全景视频生成必须被视为一个几何建模问题,而不是简单的视觉合成问题。这一认识对于具身AI应用至关重要,因为这类应用需要准确的空间理解能力——例如机器人导航和虚拟环境交互。

该研究由Le Jiang等十位作者共同完成,相关代码已在GitHub上开源(https://github.com/ostadabbas/PanoWorld)。论文已提交至arXiv预印本平台,编号为2605.15391。这项工作不仅推动了全景视频生成技术的发展,也为未来几何感知视觉模型的研发提供了新的方向和基准。