隨着通用型機器人策略模型——尤其是視覺語言行動(VLA)模型——開始進入真實物理世界部署,評估機器人操作策略變得越來越關鍵。但當前以真實環境為主的評測範式仍然高度依賴人工:需要反覆執行硬件試驗、手動重置場景、由操作員持續盯守;不同輪次之間的結果波動可能讓同一策略獲得不同排名;最終統計往往以成功/失敗二元指標為核心,難以反映執行動作是否流暢、合理。相比之下,人類觀察機器人時,會通過一段完整行為比較不同策略的表現,而不是隻看最終狀態。
針對這個問題,Yidi Wang 等人在 2026 年 9 月 3 日提交至 arXiv 的論文(編號 2609.03276,cs.RO)中提出 R2S-Eval 評估流程。該流程由兩個關鍵部分構成。第一部分是 real-to-sim(真實到仿真)校準:在按真實評測環境建立並校準過的仿真器中生成 rollout 視頻。與傳統方式相比,研究者不必在每輪比較中都操作實體機器人,而可以在與真實場景對標的模擬環境裏先行採集行為樣本,從而降低硬件重複操作和人工干預成本。第二部分是視覺語言模型(VLM)評估器:將 rollout 視頻交給 VLM,要求 VLM 判斷執行的完整軌跡質量,輸出成對偏好比較;之後將多組成對偏好彙總為統一策略排名。作者還提出了配套驗證協議,用來確認整個評估流程是否能夠得到經過驗證的結論,並避開傳統真實評估中容易出現的不穩定因素。
實驗在仿真與真實兩類環境中展開。作者報告,R2S-Eval 能產生可靠、穩定的策略排名,與人類偏好具有一致性,同時顯著減少重複硬件操作次數。更重要的是,基於偏好的質量判斷能夠捕捉到二元成功標籤無法體現的差異——例如接近目標過程中路徑是否合理、動作是否存在多餘抖動、任務執行順序是否自然等。作者認為,R2S-Eval 的意義在於將機器人評估從手工計數成功率,推進到自動化、統計穩定並關心行為質量的評價範式。
該論文的作者列表包含 Yidi Wang 及其六位合著者;研究歸屬 Robotics(cs.RO)子類。arXiv 網址為 https://arxiv.org/abs/2609.03276,DOI 為 10.48550/arXiv.2609.03276。論文項目主頁位於 r2s-eval.github.io,可查看代碼、示例和後續更新。