跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

感知哪種模態至關重要:面向魯棒VLA策略的證據門控正則化

文章摘要

視覺-語言-動作(VLA)策略在有限的、同質的機器人演示上訓練時,容易學習到傳感器之間的虛假相關性,而不是任務相關信號;這種失敗模式被稱為“模態糾纏”。為應對真實世界中的遮擋與干擾,該論文提出證據門控正則化(EGR),一種零推理開銷的訓練目標。EGR 利用逐幀、逐傳感器的任務相關性估計,對低證據傳感器施加不變性約束、對高證據傳感器施加單傳感器充分性約束。在基於 BEHAVIOR-1K 的基準測試和兩套真實機器人平台上,EGR 顯著提升成功率:單傳感器回退場景提升 120%,雙臂平台在物理干擾下提升 183%。

來源arXiv Robotics作者: Yue Yang, Diego Romeres, Chiori Hori, Gedas Bertasius, Daniel Szafir, Siddarth Jain
感知哪種模態至關重要:面向魯棒VLA策略的證據門控正則化
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

視覺-語言-動作(Vision-Language-Action,VLA)模型將視覺、語言和動作執行結合起來,是機器人學習領域備受關注的方向。然而,這類模型的實際部署仍面臨一個隱性風險:當機器人依賴多路傳感器輸入時,模型可能會“偷懶”地利用傳感器之間的統計關聯來推斷動作,而非真正理解任務。由於機器人演示數據的採集成本高,訓練集通常規模有限且同質化嚴重,這種傾向會使模型學到大量虛假的跨傳感器相關性。這篇由Yue Yang等六位作者撰寫、於2026年9月2日提交至arXiv的論文,將這些虛假相關導致的失敗統稱為模態糾纏。

模態糾纏在真實環境中會表現為兩種棘手問題。第一種是干擾敏感性:當一個與任務無關的傳感器被遮擋、損壞或加入干擾時,策略的輸出會明顯波動,出現意料之外的錯誤;第二種是單模態不充分性:當只有某一路真正攜帶任務信息的傳感器可用時,模型又因為過度依賴其他傳感器的相關性而無法獨立完成判斷。換言之,模型的魯棒性被“平均主義”的傳感器融合方式削弱了。

針對上述問題,論文提出證據門控正則化(Evidence-Gated Regularization,EGR)。該訓練目標並不侷限於某一種模態,而是先為每一幀、每一個傳感器計算一個任務相關性的“證據”信號,再用這個信號門控兩類狀態條件一致性約束:在低證據傳感器上施加不變性約束,要求策略對該傳感器的擾動始終保持一致的行為;在高證據傳感器上施加單傳感器充分性約束,鼓勵策略在僅僅使用該傳感器時也能達到足夠好的決策效果。EGR在推理時不引入任何額外計算開銷,因此可以相對直接地用於現有的VLA策略訓練流程。

為了讓這一問題得到更系統的評測,作者構建了一個基於BEHAVIOR-1K的基準,既包含無需完整執行即可快速診斷的推理測試套件,也包含47個需要完整rollout的長程技能任務,專門針對模態糾纏現象進行壓力測試。此外,論文還在兩套構型完全不同的真實機器人平台上驗證了EGR的有效性:一套是使用兩台Kinova機械臂和三個RGB攝像頭的雙臂系統;另一套是採用單臂MELFA ASSISTA、融合視覺與GelSight觸覺傳感器的單臂系統。

在BEHAVIOR-1K仿真環境中,EGR帶來了穩定且顯著的成功率提升:完整模態下成功率從12.5%提升至16.4%,相對提升約31%;無信息相關傳感器被破壞時,成功率從9.4%提升至16.5%,相對提升約75%;而僅在單一相關傳感器可用時,成功率從2.8%提升至6.1%,相對提升約120%。真實機器人實驗中還額外加入了物理物體作為干擾源。結果表明,EGR在雙臂系統上的成功率從30%提升至85%,相對提升達183%;在融合觸覺傳感器的單臂系統上,成功率從55%提升至70%,相對提升27%。

綜合來看,本文通過“識別哪些傳感器真正起作用”的思路,為多模態機器人策略的魯棒性提供了一條輕量且有效的新路徑。與許多需要改變模型結構或增加測試時計算的方法不同,EGR把工作重心放在訓練階段,不改變推理時的輸入管線。論文作者也希望,這種顯式關注“模態是否可靠”的訓練方式,能幫助VLA策略在真實、開放且充滿干擾的環境中更加穩定地完成操縱任務。

展開要點與分析

文章情報

工程師進階

要點

  • 在有限且同質的機器人演示上訓練的VLA策略,會學習到虛假的跨傳感器相關性,這種失敗被稱作“模態糾纏”。
  • 證據門控正則化(EGR)通過逐幀、逐傳感器的任務相關性門控一致性目標,且推理時零額外開銷。
  • 在仿真中,EGR將完整模態下的成功率從12.5%提升到16.4%,無信息傳感器損壞時從9.4%提升到16.5%,單傳感器回退時從2.8%提升到6.1%。
  • 在真實機器人上,EGR將雙臂Kinova平台在物理干擾下的成功率從30%提高到85%,將MELFA ASSISTA觸覺平台從55%提高到70%。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。