轨迹感知的跨视角地理定位:基于序列观测的方法
跨视角地理定位将地面观测与卫星图像匹配。最新方法利用视频片段等序列查询获得更丰富的时空线索,但忽略了路线描述这一互补模态。本文提出SeqGeo-VL数据集(约3.9万视频-文本-卫星三元组)和TrajLoc统一框架,同时处理视频和路线描述,通过密集视觉与抽象语言语义相互增强。还提出TrajMod轻量模块,根据轨迹几何条件化查询嵌入,实现空间感知表示。实验表明TrajLoc在视频和文本地理定位上显著超越现有方法。
跨视角地理定位(Cross-view Geo-localization)是一项将地面拍摄的图像或视频与卫星图像进行匹配的技术,在无人驾驶、机器人导航和增强现实等领域具有广泛应用。传统方法通常依赖单张地面图像,但序列数据如视频片段能够提供更丰富的时空线索,从而提升匹配精度。然而,现有基于序列的方法大多只考虑视觉信息,而忽略了另一种重要的序列模态——路线描述。路线描述是用自然语言描述的行进路径,它能够以更高的抽象层次捕捉轨迹信息,并且在实际场景中常常是唯一的输入来源(例如用户口头告知自动驾驶车辆接载地点)。
为了填补这一空白,由Tianyi Gao等人组成的研究团队在ECCV 2026上发表了题为《Trajectory-aware Cross-view Geo-localization with Sequential Observations》的论文。他们提出了SeqGeo-VL数据集,该数据集包含约3.9万个视频-文本-卫星三元组,覆盖了多样化的地理场景和天气条件。在此基础上,团队构建了TrajLoc统一框架,该框架能够同时处理视频片段和路线描述两种模态的查询。通过利用密集视觉特征与抽象语言语义的相互增强,TrajLoc显著提升了跨视角匹配的准确性和鲁棒性。
TrajLoc的核心创新之一是TrajMod轻量模块。该模块利用轨迹几何信息(如路径形状和方向变化)对查询嵌入进行条件化,从而生成空间感知的表示。这种表示能够更好地对齐地面轨迹与卫星图像中的对应区域。实验在多个数据集上验证了TrajLoc的有效性:在视频地理定位任务中,它比现有最优方法提升了超过10%的召回率;在文本地理定位任务中,也取得了显著的性能提升。项目主页和代码已公开,为后续研究提供了坚实的基础。