SAP-Nav:面向分层开放词汇目标导航的空间语义表示与主动感知
SAP-Nav 是一种完全在线、零样本的分层开放词汇目标导航框架。它通过主动获取的房间视图增量构建可查询的空间语义表示,并利用主动视点验证在证据不足时重新定位智能体。在 LangMap 和 HM3D-OVON 基准上,它取得了总体最佳性能,区域级导航成功率较基于训练的方法提升 12.2%,并在真实机器人实验中验证了可行性。
分层开放词汇目标导航(Hierarchical Open-Vocabulary Object Navigation, OVON)要求智能体在未见过的环境中,仅依靠自由形式的自然语言指令,完成从场景、房间、区域到实例的多层级目标定位与导航。虽然已有工作 LangMap 对这一任务进行了形式化定义,但在部分观测条件下,仅凭单次视角往往难以同时满足空间锚定与目标验证的需求——空间定位需要跨视角的、可持续积累的环境级证据,而目标验证则需要清晰且具有区分度的候选视图。
针对这一挑战,来自研究团队的 Xuetong Pei 等七位作者提出了 SAP-Nav。这是一种完全在线、零样本的导航框架,核心思想是将空间语义表示与主动感知相结合。智能体在探索过程中,通过主动获取的房间视角增量式构建一种可查询的空间语义表示(Queryable Spatial-Semantic Representation)。借助该表示,智能体可以从任何已探索的位置发出空间语义查询,而不必依赖预先构建的场景地图或离线训练。
为了在部分观测下做出可靠判断,SAP-Nav 进一步引入了主动视点验证(Active Viewpoint Verification)机制。该机制会评估当前观测是否已经包含足够证据来确认或排除目标候选;如果证据不足,智能体会先重新定位到一个信息量更丰富的视点,再基于类别与属性约束对候选目标进行验证。这种“先观察、后确认”的策略,避免了在模糊视角下贸然决策。
SAP-Nav 虽然面向层级 OVON 设计,但同样适用于标准类别级 OVON,且无需针对特定任务进行微调,也不需要预计算的场景地图,使其具备很强的泛化性。在 LangMap 和 HM3D-OVON 两个基准上的实验显示,SAP-Nav 取得了总体最优性能,尤其在区域级导航任务上,其成功率(SR)相比基于训练的方法提升了 12.2%。此外,真实机器人平台上的实验也验证了该框架在实际物理环境中的可行性。
论文以 arXiv:2608.12707 编号于 2026 年 8 月 13 日提交,作者团队承诺在论文被接收后公开代码。该工作为开放词汇目标导航提供了一种无需重新训练、即时可部署的解决思路,有望推动服务机器人在未知环境中理解并执行自然语言导航指令。