跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

R2S-Eval:基于视觉语言模型的真实到仿真校准机器人评估

文章摘要

论文提出R2S-Eval,一种结合真实到仿真校准与视觉语言模型偏好评级的机器人操作策略评估流程。它通过在已校准的仿真器中生成rollout视频来减少重复硬件试验,并利用VLM对执行质量进行两两比较,进而汇总出策略排名。实验显示该方法比传统成功率评估更可靠、更稳定,且与人类偏好一致,能揭示二进制成功标签无法反映的行为质量差异。

来源arXiv Robotics作者: Yidi Wang, Feixiang Ruan, Ruoqu Chen, Jie Yin, Yang Yu, Mengdi Xu, Kaifeng Zhang
R2S-Eval:基于视觉语言模型的真实到仿真校准机器人评估
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

随着通用型机器人策略模型——尤其是视觉语言行动(VLA)模型——开始进入真实物理世界部署,评估机器人操作策略变得越来越关键。但当前以真实环境为主的评测范式仍然高度依赖人工:需要反复执行硬件试验、手动重置场景、由操作员持续盯守;不同轮次之间的结果波动可能让同一策略获得不同排名;最终统计往往以成功/失败二元指标为核心,难以反映执行动作是否流畅、合理。相比之下,人类观察机器人时,会通过一段完整行为比较不同策略的表现,而不是只看最终状态。

针对这个问题,Yidi Wang 等人在 2026 年 9 月 3 日提交至 arXiv 的论文(编号 2609.03276,cs.RO)中提出 R2S-Eval 评估流程。该流程由两个关键部分构成。第一部分是 real-to-sim(真实到仿真)校准:在按真实评测环境建立并校准过的仿真器中生成 rollout 视频。与传统方式相比,研究者不必在每轮比较中都操作实体机器人,而可以在与真实场景对标的模拟环境里先行采集行为样本,从而降低硬件重复操作和人工干预成本。第二部分是视觉语言模型(VLM)评估器:将 rollout 视频交给 VLM,要求 VLM 判断执行的完整轨迹质量,输出成对偏好比较;之后将多组成对偏好汇总为统一策略排名。作者还提出了配套验证协议,用来确认整个评估流程是否能够得到经过验证的结论,并避开传统真实评估中容易出现的不稳定因素。

实验在仿真与真实两类环境中展开。作者报告,R2S-Eval 能产生可靠、稳定的策略排名,与人类偏好具有一致性,同时显著减少重复硬件操作次数。更重要的是,基于偏好的质量判断能够捕捉到二元成功标签无法体现的差异——例如接近目标过程中路径是否合理、动作是否存在多余抖动、任务执行顺序是否自然等。作者认为,R2S-Eval 的意义在于将机器人评估从手工计数成功率,推进到自动化、统计稳定并关心行为质量的评价范式。

该论文的作者列表包含 Yidi Wang 及其六位合著者;研究归属 Robotics(cs.RO)子类。arXiv 网址为 https://arxiv.org/abs/2609.03276,DOI 为 10.48550/arXiv.2609.03276。论文项目主页位于 r2s-eval.github.io,可查看代码、示例和后续更新。

展开要点与分析

文章情报

工程师进阶

要点

  • R2S-Eval结合“real-to-sim”校准与视觉语言模型(VLM)偏好评估,替代传统人工成功率统计。
  • 在仿真中生成与真实评估环境校准的rollout视频,减少重复硬件试验和人工场景重置。
  • VLM评估器根据执行质量给出两两偏好,聚合成策略排名,结论更稳定并与人类偏好一致。
  • 实验显示能暴露二进制成功标签无法捕捉的行为质量差异,推进自动化、质量感知的机器人评估。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。