2026年9月21日,arXiv 平台上发布了一篇题为《Capability-Aware Arbitration for Semantic Intent-Based Shared Control》(面向语义意图共享控制的能力感知仲裁)的论文,作者为 Zhaoda Du 等三位研究者,编号为 arXiv:2609.25369v1,归类于机器人学(cs.RO)。
共享控制的核心问题在于:机器人究竟应当在多大程度上接管控制权。传统方法通常依据对推断出的人类意图的置信度来分配机器人权限,并默认自主执行是可靠的。然而,一旦这一假设不成立,过高的意图置信度反而会引发“过度帮助”(over-helping),让机器人做出用户并不期望的动作,从而损害协作体验。
针对这一问题,论文提出了一个能力感知(capability-aware)的共享控制框架,同时考虑两方面的信息:其一,由视觉语言模型(VLM)推断人类意图并给出语义意图置信度;其二,由视觉-语言-动作(VLA)策略生成自主动作,并在线估计 VLA 的能力置信度。
VLA 能力置信度的估计方式颇具新意:作者通过随机动作轨迹的离散程度(dispersion)与局部不稳定性(local instability)来在线量化策略当前执行任务的可靠程度,而不是简单地依赖单一的动作输出概率。随后,他们设计了一种非线性仲裁策略,将经过贝叶斯滤波的语义意图置信度与 VLA 能力置信度通过 Sigmoid 映射进行融合,从而自适应地调整机器人权限——当 VLA 能力不足时降低机器人权限,避免过度帮助;当 VLA 能力充足时则可以更积极地承担任务。
评估分为两部分:一是对 VLM/VLA 置信度评估本身的检验,二是由 12 名参与者完成的用户研究。参与者需要执行抓取-放置(pick-and-place)以及双向堆叠(bidirectional stacking)任务,并且实验同时覆盖分布内(in-distribution)与分布外(out-of-distribution)两种条件,以考察方法在陌生场景下的稳健性。
结果显示,所提方法取得了最高的任务成功率 92%,明显优于人工遥操作(83%)、仅依赖意图的仲裁(44%)以及固定等权混合(10%)。此外,该方法在控制友好度(control friendliness)上更高,在权限加权的分歧度(authority-weighted disagreement)上低于两个共享控制基线。作者总结认为,这些结果说明把 VLA 能力纳入权限分配,有助于缓解过度帮助并提升共享控制的整体表现。
论文全文、PDF 与实验性 HTML 版本均可在 arXiv 页面获取(DOI: 10.48550/arXiv.2609.25369,DataCite 注册待完成)。提交信息显示,v1 版本于 2026 年 9 月 21 日 20:08:39 UTC 提交,文件大小约 7,357 KB。