利用语义地图实现城市尺度跨视角定位
本文提出一种基于视觉语言模型(VLM)的机器人定位方法,利用OpenStreetMap的丰富语义信息,从全景图中提取地标并与先验地图匹配,通过蒸馏轻量级匹配器提高效率,并在多种环境(包括雪夜)中验证了泛化能力。
机器人定位是自主导航的核心问题之一,尤其是在从未遍历过的环境中。传统方法通常依赖GPS或高精地图,但GPS在室内或城市峡谷中不可靠,而高精地图的构建和维护成本高昂。近年来,研究者开始探索利用开源地图数据(如OpenStreetMap)进行定位,但这些方法往往忽略其中的丰富语义信息,直接将全景图与航拍图匹配,或者仅使用少数固定类别压缩语义。
来自麻省理工学院和加州大学伯克利分校的研究团队提出了一种基于视觉语言模型(VLM)的新方法,旨在充分利用OpenStreetMap中的语义信息实现城市尺度的跨视角定位。该方法首先从机器人采集的全景图中提取语义地标,例如建筑、路口、标志性设施等,然后与OpenStreetMap中的先验语义地图进行关联。然而,直接使用VLM为地图上的所有地标提议对应关系会导致计算量随地图规模爆炸式增长,例如在628平方公里的区域中可能包含数千个地标。
为解决这一可扩展性问题,研究者提出从VLM中蒸馏出一个轻量级的匹配器。该匹配器能够高效计算地图中所有实体与观测地标之间的对应关系,从而形成观测似然函数。随后,通过贝叶斯滤波器将连续时间的观测结果融合,生成平滑的位姿估计序列。实验表明,即使在单一城市的好天气数据上训练,该方法也能推广到不同的位置、光照条件和恶劣天气(如波士顿的暴风雪和夜晚)。
为促进相关研究,团队还发布了一个包含11种环境的数据集,涵盖了提取的语义信息和评估轨迹,包括在雪夜和夜间收集的全景图。代码和数据集均已开源。这一工作为利用现成语义地图进行鲁棒定位提供了新思路,有望降低机器人部署对昂贵地图构建的依赖。