2026年9月21日,arXiv 平台上發佈了一篇題為《Capability-Aware Arbitration for Semantic Intent-Based Shared Control》(面向語義意圖共享控制的能力感知仲裁)的論文,作者為 Zhaoda Du 等三位研究者,編號為 arXiv:2609.25369v1,歸類於機器人學(cs.RO)。
共享控制的核心問題在於:機器人究竟應當在多大程度上接管控制權。傳統方法通常依據對推斷出的人類意圖的置信度來分配機器人權限,並默認自主執行是可靠的。然而,一旦這一假設不成立,過高的意圖置信度反而會引發“過度幫助”(over-helping),讓機器人做出用户並不期望的動作,從而損害協作體驗。
針對這一問題,論文提出了一個能力感知(capability-aware)的共享控制框架,同時考慮兩方面的信息:其一,由視覺語言模型(VLM)推斷人類意圖並給出語義意圖置信度;其二,由視覺-語言-動作(VLA)策略生成自主動作,並在線估計 VLA 的能力置信度。
VLA 能力置信度的估計方式頗具新意:作者通過隨機動作軌跡的離散程度(dispersion)與局部不穩定性(local instability)來在線量化策略當前執行任務的可靠程度,而不是簡單地依賴單一的動作輸出概率。隨後,他們設計了一種非線性仲裁策略,將經過貝葉斯濾波的語義意圖置信度與 VLA 能力置信度通過 Sigmoid 映射進行融合,從而自適應地調整機器人權限——當 VLA 能力不足時降低機器人權限,避免過度幫助;當 VLA 能力充足時則可以更積極地承擔任務。
評估分為兩部分:一是對 VLM/VLA 置信度評估本身的檢驗,二是由 12 名參與者完成的用户研究。參與者需要執行抓取-放置(pick-and-place)以及雙向堆疊(bidirectional stacking)任務,並且實驗同時覆蓋分佈內(in-distribution)與分佈外(out-of-distribution)兩種條件,以考察方法在陌生場景下的穩健性。
結果顯示,所提方法取得了最高的任務成功率 92%,明顯優於人工遙操作(83%)、僅依賴意圖的仲裁(44%)以及固定等權混合(10%)。此外,該方法在控制友好度(control friendliness)上更高,在權限加權的分歧度(authority-weighted disagreement)上低於兩個共享控制基線。作者總結認為,這些結果説明把 VLA 能力納入權限分配,有助於緩解過度幫助並提升共享控制的整體表現。
論文全文、PDF 與實驗性 HTML 版本均可在 arXiv 頁面獲取(DOI: 10.48550/arXiv.2609.25369,DataCite 註冊待完成)。提交信息顯示,v1 版本於 2026 年 9 月 21 日 20:08:39 UTC 提交,文件大小約 7,357 KB。