随着通用型机器人策略模型——尤其是视觉语言行动(VLA)模型——开始进入真实物理世界部署,评估机器人操作策略变得越来越关键。但当前以真实环境为主的评测范式仍然高度依赖人工:需要反复执行硬件试验、手动重置场景、由操作员持续盯守;不同轮次之间的结果波动可能让同一策略获得不同排名;最终统计往往以成功/失败二元指标为核心,难以反映执行动作是否流畅、合理。相比之下,人类观察机器人时,会通过一段完整行为比较不同策略的表现,而不是只看最终状态。
针对这个问题,Yidi Wang 等人在 2026 年 9 月 3 日提交至 arXiv 的论文(编号 2609.03276,cs.RO)中提出 R2S-Eval 评估流程。该流程由两个关键部分构成。第一部分是 real-to-sim(真实到仿真)校准:在按真实评测环境建立并校准过的仿真器中生成 rollout 视频。与传统方式相比,研究者不必在每轮比较中都操作实体机器人,而可以在与真实场景对标的模拟环境里先行采集行为样本,从而降低硬件重复操作和人工干预成本。第二部分是视觉语言模型(VLM)评估器:将 rollout 视频交给 VLM,要求 VLM 判断执行的完整轨迹质量,输出成对偏好比较;之后将多组成对偏好汇总为统一策略排名。作者还提出了配套验证协议,用来确认整个评估流程是否能够得到经过验证的结论,并避开传统真实评估中容易出现的不稳定因素。
实验在仿真与真实两类环境中展开。作者报告,R2S-Eval 能产生可靠、稳定的策略排名,与人类偏好具有一致性,同时显著减少重复硬件操作次数。更重要的是,基于偏好的质量判断能够捕捉到二元成功标签无法体现的差异——例如接近目标过程中路径是否合理、动作是否存在多余抖动、任务执行顺序是否自然等。作者认为,R2S-Eval 的意义在于将机器人评估从手工计数成功率,推进到自动化、统计稳定并关心行为质量的评价范式。
该论文的作者列表包含 Yidi Wang 及其六位合著者;研究归属 Robotics(cs.RO)子类。arXiv 网址为 https://arxiv.org/abs/2609.03276,DOI 为 10.48550/arXiv.2609.03276。论文项目主页位于 r2s-eval.github.io,可查看代码、示例和后续更新。