跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

面向語義意圖共享控制的 capability-aware 仲裁機制

文章摘要

該論文提出一種 capability-aware 共享控制框架:由視覺語言模型(VLM)推斷人類意圖並給出語義意圖置信度,同時由視覺-語言-動作(VLA)策略生成自主動作,並從隨機動作軌跡的離散度與區域性不穩定性線上估計 VLA 能力置信度。透過 sigmoid 對映將貝葉斯濾波後的意圖置信度與 VLA 能力置信度結合,非線性仲裁機器人控制權。12 名參與者實驗顯示該方法任務成功率達 92%,高於手動遙操作(83%)、僅意圖仲裁(44%)和固定等權混合(10%),並提升控制友好度、降低控制權加權分歧。

來源arXiv Robotics作者: Zhaoda Du, Michael Bowman, Xiaoli Zhang
面向語義意圖共享控制的 capability-aware 仲裁機制
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

2026年9月21日,arXiv 平臺上釋出了一篇題為《Capability-Aware Arbitration for Semantic Intent-Based Shared Control》(面向語義意圖共享控制的能力感知仲裁)的論文,作者為 Zhaoda Du 等三位研究者,編號為 arXiv:2609.25369v1,歸類於機器人學(cs.RO)。

共享控制的核心問題在於:機器人究竟應當在多大程度上接管控制權。傳統方法通常依據對推斷出的人類意圖的置信度來分配機器人許可權,並預設自主執行是可靠的。然而,一旦這一假設不成立,過高的意圖置信度反而會引發“過度幫助”(over-helping),讓機器人做出使用者並不期望的動作,從而損害協作體驗。

針對這一問題,論文提出了一個能力感知(capability-aware)的共享控制框架,同時考慮兩方面的資訊:其一,由視覺語言模型(VLM)推斷人類意圖並給出語義意圖置信度;其二,由視覺-語言-動作(VLA)策略生成自主動作,並線上估計 VLA 的能力置信度。

VLA 能力置信度的估計方式頗具新意:作者透過隨機動作軌跡的離散程度(dispersion)與區域性不穩定性(local instability)來線上量化策略當前執行任務的可靠程度,而不是簡單地依賴單一的動作輸出機率。隨後,他們設計了一種非線性仲裁策略,將經過貝葉斯濾波的語義意圖置信度與 VLA 能力置信度透過 Sigmoid 對映進行融合,從而自適應地調整機器人許可權——當 VLA 能力不足時降低機器人許可權,避免過度幫助;當 VLA 能力充足時則可以更積極地承擔任務。

評估分為兩部分:一是對 VLM/VLA 置信度評估本身的檢驗,二是由 12 名參與者完成的使用者研究。參與者需要執行抓取-放置(pick-and-place)以及雙向堆疊(bidirectional stacking)任務,並且實驗同時覆蓋分佈內(in-distribution)與分佈外(out-of-distribution)兩種條件,以考察方法在陌生場景下的穩健性。

結果顯示,所提方法取得了最高的任務成功率 92%,明顯優於人工遙操作(83%)、僅依賴意圖的仲裁(44%)以及固定等權混合(10%)。此外,該方法在控制友好度(control friendliness)上更高,在許可權加權的分歧度(authority-weighted disagreement)上低於兩個共享控制基線。作者總結認為,這些結果說明把 VLA 能力納入許可權分配,有助於緩解過度幫助並提升共享控制的整體表現。

論文全文、PDF 與實驗性 HTML 版本均可在 arXiv 頁面獲取(DOI: 10.48550/arXiv.2609.25369,DataCite 註冊待完成)。提交資訊顯示,v1 版本於 2026 年 9 月 21 日 20:08:39 UTC 提交,檔案大小約 7,357 KB。

展開要點與分析

文章情報

投資人進階

要點

  • VLM 提供語義意圖置信度,VLA 策略生成自主動作,並從隨機軌跡離散度與區域性不穩定性線上估計其能力置信度。
  • 非線性仲裁策略透過 sigmoid 對映融合貝葉斯濾波意圖置信度與 VLA 能力置信度,動態調整機器人控制權。
  • 12 人使用者研究(含分佈內與分佈外條件)中任務成功率達 92%,優於遙操作 83% 及兩種共享控制基線。
  • 結果表明引入 VLA 能力可緩解“過度幫助”問題並提升共享控制表現。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。