跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

面向语义意图共享控制的 capability-aware 仲裁机制

文章摘要

该论文提出一种 capability-aware 共享控制框架:由视觉语言模型(VLM)推断人类意图并给出语义意图置信度,同时由视觉-语言-动作(VLA)策略生成自主动作,并从随机动作轨迹的离散度与局部不稳定性在线估计 VLA 能力置信度。通过 sigmoid 映射将贝叶斯滤波后的意图置信度与 VLA 能力置信度结合,非线性仲裁机器人控制权。12 名参与者实验显示该方法任务成功率达 92%,高于手动遥操作(83%)、仅意图仲裁(44%)和固定等权混合(10%),并提升控制友好度、降低控制权加权分歧。

来源arXiv Robotics作者: Zhaoda Du, Michael Bowman, Xiaoli Zhang
面向语义意图共享控制的 capability-aware 仲裁机制
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

2026年9月21日,arXiv 平台上发布了一篇题为《Capability-Aware Arbitration for Semantic Intent-Based Shared Control》(面向语义意图共享控制的能力感知仲裁)的论文,作者为 Zhaoda Du 等三位研究者,编号为 arXiv:2609.25369v1,归类于机器人学(cs.RO)。

共享控制的核心问题在于:机器人究竟应当在多大程度上接管控制权。传统方法通常依据对推断出的人类意图的置信度来分配机器人权限,并默认自主执行是可靠的。然而,一旦这一假设不成立,过高的意图置信度反而会引发“过度帮助”(over-helping),让机器人做出用户并不期望的动作,从而损害协作体验。

针对这一问题,论文提出了一个能力感知(capability-aware)的共享控制框架,同时考虑两方面的信息:其一,由视觉语言模型(VLM)推断人类意图并给出语义意图置信度;其二,由视觉-语言-动作(VLA)策略生成自主动作,并在线估计 VLA 的能力置信度。

VLA 能力置信度的估计方式颇具新意:作者通过随机动作轨迹的离散程度(dispersion)与局部不稳定性(local instability)来在线量化策略当前执行任务的可靠程度,而不是简单地依赖单一的动作输出概率。随后,他们设计了一种非线性仲裁策略,将经过贝叶斯滤波的语义意图置信度与 VLA 能力置信度通过 Sigmoid 映射进行融合,从而自适应地调整机器人权限——当 VLA 能力不足时降低机器人权限,避免过度帮助;当 VLA 能力充足时则可以更积极地承担任务。

评估分为两部分:一是对 VLM/VLA 置信度评估本身的检验,二是由 12 名参与者完成的用户研究。参与者需要执行抓取-放置(pick-and-place)以及双向堆叠(bidirectional stacking)任务,并且实验同时覆盖分布内(in-distribution)与分布外(out-of-distribution)两种条件,以考察方法在陌生场景下的稳健性。

结果显示,所提方法取得了最高的任务成功率 92%,明显优于人工遥操作(83%)、仅依赖意图的仲裁(44%)以及固定等权混合(10%)。此外,该方法在控制友好度(control friendliness)上更高,在权限加权的分歧度(authority-weighted disagreement)上低于两个共享控制基线。作者总结认为,这些结果说明把 VLA 能力纳入权限分配,有助于缓解过度帮助并提升共享控制的整体表现。

论文全文、PDF 与实验性 HTML 版本均可在 arXiv 页面获取(DOI: 10.48550/arXiv.2609.25369,DataCite 注册待完成)。提交信息显示,v1 版本于 2026 年 9 月 21 日 20:08:39 UTC 提交,文件大小约 7,357 KB。

展开要点与分析

文章情报

投资人进阶

要点

  • VLM 提供语义意图置信度,VLA 策略生成自主动作,并从随机轨迹离散度与局部不稳定性在线估计其能力置信度。
  • 非线性仲裁策略通过 sigmoid 映射融合贝叶斯滤波意图置信度与 VLA 能力置信度,动态调整机器人控制权。
  • 12 人用户研究(含分布内与分布外条件)中任务成功率达 92%,优于遥操作 83% 及两种共享控制基线。
  • 结果表明引入 VLA 能力可缓解“过度帮助”问题并提升共享控制表现。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。