視覺-語言-動作(Vision-Language-Action,VLA)模型將視覺、語言和動作執行結合起來,是機器人學習領域備受關注的方向。然而,這類模型的實際部署仍面臨一個隱性風險:當機器人依賴多路傳感器輸入時,模型可能會“偷懶”地利用傳感器之間的統計關聯來推斷動作,而非真正理解任務。由於機器人演示數據的採集成本高,訓練集通常規模有限且同質化嚴重,這種傾向會使模型學到大量虛假的跨傳感器相關性。這篇由Yue Yang等六位作者撰寫、於2026年9月2日提交至arXiv的論文,將這些虛假相關導致的失敗統稱為模態糾纏。
模態糾纏在真實環境中會表現為兩種棘手問題。第一種是干擾敏感性:當一個與任務無關的傳感器被遮擋、損壞或加入干擾時,策略的輸出會明顯波動,出現意料之外的錯誤;第二種是單模態不充分性:當只有某一路真正攜帶任務信息的傳感器可用時,模型又因為過度依賴其他傳感器的相關性而無法獨立完成判斷。換言之,模型的魯棒性被“平均主義”的傳感器融合方式削弱了。
針對上述問題,論文提出證據門控正則化(Evidence-Gated Regularization,EGR)。該訓練目標並不侷限於某一種模態,而是先為每一幀、每一個傳感器計算一個任務相關性的“證據”信號,再用這個信號門控兩類狀態條件一致性約束:在低證據傳感器上施加不變性約束,要求策略對該傳感器的擾動始終保持一致的行為;在高證據傳感器上施加單傳感器充分性約束,鼓勵策略在僅僅使用該傳感器時也能達到足夠好的決策效果。EGR在推理時不引入任何額外計算開銷,因此可以相對直接地用於現有的VLA策略訓練流程。
為了讓這一問題得到更系統的評測,作者構建了一個基於BEHAVIOR-1K的基準,既包含無需完整執行即可快速診斷的推理測試套件,也包含47個需要完整rollout的長程技能任務,專門針對模態糾纏現象進行壓力測試。此外,論文還在兩套構型完全不同的真實機器人平台上驗證了EGR的有效性:一套是使用兩台Kinova機械臂和三個RGB攝像頭的雙臂系統;另一套是採用單臂MELFA ASSISTA、融合視覺與GelSight觸覺傳感器的單臂系統。
在BEHAVIOR-1K仿真環境中,EGR帶來了穩定且顯著的成功率提升:完整模態下成功率從12.5%提升至16.4%,相對提升約31%;無信息相關傳感器被破壞時,成功率從9.4%提升至16.5%,相對提升約75%;而僅在單一相關傳感器可用時,成功率從2.8%提升至6.1%,相對提升約120%。真實機器人實驗中還額外加入了物理物體作為干擾源。結果表明,EGR在雙臂系統上的成功率從30%提升至85%,相對提升達183%;在融合觸覺傳感器的單臂系統上,成功率從55%提升至70%,相對提升27%。
綜合來看,本文通過“識別哪些傳感器真正起作用”的思路,為多模態機器人策略的魯棒性提供了一條輕量且有效的新路徑。與許多需要改變模型結構或增加測試時計算的方法不同,EGR把工作重心放在訓練階段,不改變推理時的輸入管線。論文作者也希望,這種顯式關注“模態是否可靠”的訓練方式,能幫助VLA策略在真實、開放且充滿干擾的環境中更加穩定地完成操縱任務。