近日,一篇题为《VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models》的论文提交至arXiv(编号2609.04355),由Chenyu Su等10位作者共同完成。该研究聚焦于视觉-语言-动作(VLA)模型在真实世界在线强化学习(RL)中的效率与精度问题。论文指出,预训练的VLA模型虽能完成广泛的操控任务,但在需要高精度和可重复性的场景下仍不可靠。将真实世界在线RL应用于VLA后训练,可通过自主试错超越单纯演示学习的局限,但面临两大瓶颈:一是不可靠的价值信号可能导致策略漂移;二是大型VLA的计算开销限制了吞吐量和样本效率。为此,作者提出了VLA-Precision框架,包含非对称协同自举(ACoB)算法和ACoB-Stream架构。ACoB算法跨时间尺度建立非对称协同自举:早期由干预引导的行为学习快速提升策略性能,同时优化在线经验质量;随着自主经验积累,全局回报传播和局部偏好排序逐步校准价值估计,生成相对动作优势,用于参考正则化的策略改进,同时抑制策略漂移。ACoB-Stream架构采用闭环经验-策略设计,以实现不变状态解耦和按需流式传输为原则,使大型VLA上的ACoB训练获得高达10.9倍的吞吐量和计算效率提升。研究在四大类共九个高精度化学任务、四种机器人实体上进行了广泛评估,结果显示VLA-Precision的平均成功率达到98.3%,每个任务仅需45.8分钟训练时间;单个回合平均时长为27.6秒,运行速度分别达到VLA基线的1.2倍和RL基线的1.8倍。论文还提供17页正文和14幅图表,并已公开项目资源页面(https://vla-precision.github.io)。该工作为真实世界在线RL在高精度操控任务中的实用化提供了新思路,相关代码、数据和媒体资源也已同步发布,作者团队表示将进一步探索ACoB在更广泛机器人任务中的适用性。
VLA-Precision:用于视觉-语言-动作模型高效真实世界在线强化学习的非对称协同引导方法
文章摘要
预训练视觉-语言-动作(VLA)模型在通用操作上表现出色,但在高精度和可重复性要求高的任务中仍不可靠。VLA-Precision 提出 ACoB 算法与 ACoB-Stream 架构:前者通过早期干预引导、全局回报传播和局部偏好排序抑制策略漂移;后者通过不变状态解耦和按需流式处理大幅提升吞吐量。在四类机器人实体、九项高精度化学任务中平均成功率 98.3%,每项任务平均训练 45.8 分钟,运行速度分别达到 VLA 与 RL 基线的 1.2 倍和 1.8 倍。
来源arXiv Robotics作者: Chenyu Su, Zhaolong Shen, Yuan Qian, Chen Qian, Rui Zhang, Feng Yan, Weixing Chen, Fei Zhang, Jiamin Wang, Shuang Cong, Weiwei Shang
VLA-Precision:用于视觉-语言-动作模型高效真实世界在线强化学习的非对称协同引导方法