AI News HubLIVE
站内改写1 分钟阅读

MV2:用于新视角合成的多视角多车辆驾驶数据集

MV2 是一个面向动态城市场景中新视角合成(NVS)评估的多视角多车辆数据集与基准,包含汽车、踏板车和无人机同步拍摄的 50 个高质量场景、12000 张图像。测试表明,视点差异增大时 NVS 性能下降,前馈式位姿估计显著落后于优化方法。数据集、基准协议和项目资源已开源。

来源arXiv Computer Vision作者: Sanjay Bhargav Dharavath, Hanvitha Saraswathi Mukkamala, Faizan Farooq Khan, Ioannis Kakogeorgiou, Aditya Arun, C V Jawahar, Zakaria Laskar

可微渲染技术显著推进了新视角合成(Novel View Synthesis, NVS)的发展。不过,这项技术在实际驾驶场景中的应用依然充满挑战:车辆采集的视角通常比较稀疏,道路场景中存在大量动态物体,且此前缺乏多轨迹同步数据来支撑大规模视点变化的评测。为此,研究团队提出了 Multi-View Multi-Vehicle(MV2)数据集与基准,专门用于在动态城市环境中评估 NVS 模型在巨大视点变化下的表现。

MV2 最突出的特点是采用了一辆汽车、一辆踏板车和一台无人机进行同步拍摄。三者按照不同但时间同步的轨迹移动,训练时若以一种载具的摄像头画面为源、另一种载具的画面为目标,就能构造出远超现有单轨迹数据集的大范围视点变化。这种跨载具、跨轨迹的评估协议,能够更严格地检验模型是否真正学会对陌生视角进行合成,而不只是对相近视角做插值。

在数据构建环节,所有序列都通过运动恢复结构(Structure-from-Motion,SfM)进行三维配准,并使用人工标注的像素级对应关系对相机位姿进行验证,保证了图像和姿态标注的可靠性。最终得到 50 个高质量场景,共 12,000 张图像。作者对近期多种 NVS 方法和相机位姿估计方法进行了基准测试,结果发现:随着训练与测试视角之间的差异增大,NVS 质量显著下降;同时,前馈式位姿估计器的表现明显落后于基于优化的位姿估计方法。这进一步说明 MV2 可以作为驾驶场景中 NVS 能力评测的严格测试基准,能够区分不同方法在极端视角变化下的真实差距。

这篇论文共 18 页,包含 7 幅图,已被 ECCV 接收。作者为 Sanjay Bhargav Dharavath 及另外 5 位合作者。数据集、基准测试协议以及相关项目资源均已发布在项目主页 https://mv2-dataset.github.io/ 上,论文预印本可参见 arXiv:2608.12442。