AI News HubLIVE
站内改写2 分钟阅读

FUSE:通过自适应语义-几何证据获取实现主动功能可供性定位

本文提出主动功能可供性定位任务,要求具身智能体通过顺序探索场景来识别并空间定位满足功能查询的物体。作者提出FUSE框架,结合显式不确定性驱动的探索与学习得到的摊销规划器,高效选择信息丰富的视角。在基于Habitat的基准上,FUSE实现了非oracle方法中的最优定位性能,计算开销相比完全显式探索降低1.33倍,且在多种可供性知识源下均保持有效性。

来源arXiv Robotics作者: Zhou Chen, Sathyanarayanan N. Aakur

具身智能体在真实环境中经常需要根据物体的功能而不是它的类别名称来识别和操作。例如,当用户说“帮我找一个能切东西的工具”时,智能体不能只靠物体标签,而必须巡视场景、收集证据,判断哪个物体具备“切割”这个功能属性。现有可供性定位方法大多在固定视角下工作,一旦功能性线索被遮挡、模糊或不完整,模型就无法决定该往哪里看,导致定位失败或需要大量冗余扫描。针对这个缺口,周晨等人在 arXiv 提交的论文《FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition》中正式提出主动功能可供性定位任务,并给出一个名为 FUSE 的解决框架。

论文将主动功能可供性定位建模为序列决策问题:智能体在一个场景中逐步移动、选择新视角,最终找到并空间定位满足给定功能查询的物体。与静态 affordance grounding 不同,智能体需要根据已观察到的信息判断哪些区域最可能包含功能证据,并在必要时接近物体、改变视角。FUSE 框架把两种互补机制结合起来:一是显式不确定性驱动的探索,它会计算当前语义-几何证据的不确定性,优先观察不确定性高的区域;二是学习得到的摊销规划器,它用网络快速预测下一步最有信息量的视角,避免每一步都做重规划。两者配合形成自适应证据获取策略,在有限的计算预算下提高定位效率。

为了验证 FUSE,作者在 Habitat 仿真平台上建立了新的评估基准。实验结果显示,在非 oracle 方法中 FUSE 达到最高的定位性能,同时相比完全显式探索把计算量降低 1.33 倍。论文还测试了来自不同来源的功能可供性知识,FUSE 均能稳定工作,说明它不依赖某一种特定的知识表示,具备较好的泛化能力。

该论文当前处于审稿阶段,全文 15 页,包含 9 个表格和 3 张图,研究方向涵盖机器人学(cs.RO)和计算机视觉(cs.CV)。论文的 arXiv 编号为 2608.12683,于 2026 年 8 月 13 日提交,提交者信息来自 Sathyanarayanan Aakur;arXiv 已为论文分配 DOI(通过 DataCite 登记)。如果后续代码和基准公开发布,将有助于推动具身智能体在主动感知与功能理解方向上的研究进展。