跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

VLA-Precision:用於視覺-語言-動作模型高效真實世界在線強化學習的非對稱協同引導方法

文章摘要

預訓練視覺-語言-動作(VLA)模型在通用操作上表現出色,但在高精度和可重複性要求高的任務中仍不可靠。VLA-Precision 提出 ACoB 算法與 ACoB-Stream 架構:前者通過早期干預引導、全局回報傳播和局部偏好排序抑制策略漂移;後者通過不變狀態解耦和按需流式處理大幅提升吞吐量。在四類機器人實體、九項高精度化學任務中平均成功率 98.3%,每項任務平均訓練 45.8 分鐘,運行速度分別達到 VLA 與 RL 基線的 1.2 倍和 1.8 倍。

來源arXiv Robotics作者: Chenyu Su, Zhaolong Shen, Yuan Qian, Chen Qian, Rui Zhang, Feng Yan, Weixing Chen, Fei Zhang, Jiamin Wang, Shuang Cong, Weiwei Shang
VLA-Precision:用於視覺-語言-動作模型高效真實世界在線強化學習的非對稱協同引導方法
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

近日,一篇題為《VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models》的論文提交至arXiv(編號2609.04355),由Chenyu Su等10位作者共同完成。該研究聚焦於視覺-語言-動作(VLA)模型在真實世界在線強化學習(RL)中的效率與精度問題。論文指出,預訓練的VLA模型雖能完成廣泛的操控任務,但在需要高精度和可重複性的場景下仍不可靠。將真實世界在線RL應用於VLA後訓練,可通過自主試錯超越單純演示學習的侷限,但面臨兩大瓶頸:一是不可靠的價值信號可能導致策略漂移;二是大型VLA的計算開銷限制了吞吐量和樣本效率。為此,作者提出了VLA-Precision框架,包含非對稱協同自舉(ACoB)算法和ACoB-Stream架構。ACoB算法跨時間尺度建立非對稱協同自舉:早期由干預引導的行為學習快速提升策略性能,同時優化在線經驗質量;隨着自主經驗積累,全局回報傳播和局部偏好排序逐步校準價值估計,生成相對動作優勢,用於參考正則化的策略改進,同時抑制策略漂移。ACoB-Stream架構採用閉環經驗-策略設計,以實現不變狀態解耦和按需流式傳輸為原則,使大型VLA上的ACoB訓練獲得高達10.9倍的吞吐量和計算效率提升。研究在四大類共九個高精度化學任務、四種機器人實體上進行了廣泛評估,結果顯示VLA-Precision的平均成功率達到98.3%,每個任務僅需45.8分鐘訓練時間;單個回合平均時長為27.6秒,運行速度分別達到VLA基線的1.2倍和RL基線的1.8倍。論文還提供17頁正文和14幅圖表,並已公開項目資源頁面(https://vla-precision.github.io)。該工作為真實世界在線RL在高精度操控任務中的實用化提供了新思路,相關代碼、數據和媒體資源也已同步發佈,作者團隊表示將進一步探索ACoB在更廣泛機器人任務中的適用性。

展開要點與分析

文章情報

工程師進階

要點

  • ACoB 跨時間尺度建立非對稱協同引導:早期通過干預引導快速提升策略,隨後結合全局回報傳播與局部偏好排序校正價值估計並抑制策略漂移。
  • ACoB-Stream 以不變狀態解耦與按需流式處理為設計原則,使吞吐量和計算效率最高提升 10.9 倍。
  • VLA-Precision 在四類任務、四類機器人實體共九項高精度化學任務中取得 98.3% 的平均成功率,每項任務平均訓練 45.8 分鐘。
  • 論文由 Chenyu Su 等十位作者完成,2026 年 9 月 3 日提交至 arXiv(2609.04355),資源見 https://vla-precision.github.io。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。