本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

R2S-Eval:視覚言語モデルによる実機からシミュレーションへのキャリブレーションを用いたロボット評価

記事の要約

本論文は、実機からシミュレーションへのキャリブレーションと視覚言語モデル(VLM)による嗜好評価を組み合わせたロボット操作ポリシー評価パイプラインR2S-Evalを提案する。実環境に合わせて較正されたシミュレータでロールアウト動画を生成することで繰り返しのハードウェア試行を減らし、VLMが実行品質をペア比較してポリシーのランキングを集計する。実験では、従来の成功率評価よりも信頼性・安定性が高く、人間の嗜好と一致し、二値の成功ラベルでは捉えられない行動品質の差を明らかにできることが示された。

ソースarXiv Robotics著者: Yidi Wang, Feixiang Ruan, Ruoqu Chen, Jie Yin, Yang Yu, Mengdi Xu, Kaifeng Zhang
R2S-Eval:視覚言語モデルによる実機からシミュレーションへのキャリブレーションを用いたロボット評価
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

視覚言語行動(VLA)モデルをはじめとする汎用ポリシーモデルが実機ロボットに導入されるにつれ、操作ポリシーの評価手法の重要性が高まっている。しかし現状の実環境評価は、多くの人手と時間を要し、結果も不安定で、得られる情報が限られている。具体的には、ハードウェア試行の反復、手動によるシーンリセット、オペレータによる継続的な監視が必要になるうえ、同じポリシーでも評価のたびにランキングが変わることがある。また、評価指標が成功率中心であり、動作の質を十分に反映しない。一方、人間がロボットの巧拙を判断するときは、最終状態だけでなく一連の行動全体を観察し、複数のポリシーを比較している。

この課題に対して、Yidi Wang 氏らは2026年9月3日にarXivへ投稿した論文(識別番号 2609.03276、cs.RO)において、R2S-Evalを提案した。R2S-Eval は、実世界からシミュレーションへのキャリブレーション(real-to-sim calibration)と、視覚言語モデル(VLM)による嗜好評価を組み合わせた評価パイプラインである。まず、実環境の評価設定に合わせて較正されたシミュレータ上でロールアウト動画を効率的に生成する。これにより、評価のたびに実機を繰り返し動かす必要が減り、人手と時間を抑えられる。次に、VLMがロールアウト動画の実行品質を判断し、ポリシーのペアごとにどちらが優れているかの嗜好を出力する。得られたペア嗜好を集計して、ポリシーの総合ランキングを構成する。著者らはさらに、提案パイプラインが検証された結論を出せているかを評価するプロトコルも導入し、従来の実環境評価が抱える問題を軽減しようとしている。

実験はシミュレーションと実環境の両方で実施され、R2S-Evalが信頼性と安定性を持つポリシー結論を提供できることが示された。また、人間の嗜好と一致し、繰り返しの実機作業を大幅に削減し、二値の成功ラベルでは捉えられない行動品質の差を浮き彫りにすることも確認された。たとえば、目標への接近経路の自然さ、動作の滑らかさ、複数ステップの順序の妥当性などである。著者は、R2S-Evalによってロボット評価が「手動の成功数え上げ」から「自動化され、統計的に安定し、品質を考慮する評価」へ前進すると論じている。詳細な情報はプロジェクトページ(r2s-eval.github.io)で公開されている。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • R2S-Evalはreal-to-simキャリブレーションとVLMによる嗜好評価を組み合わせ、手動の成功数え上げを超える評価を実現する。
  • 較正されたシミュレータ上のロールアウト動画生成により、繰り返しの実機試行や手動のシーンリセットを削減する。
  • VLM評価器がペアごとの品質比較を行い、安定かつ人間の嗜好と整合するポリシーランキングを集計する。
  • シミュレーションと実環境の実験により、二値の成功ラベルでは見えない行動品質の差を明らかにできる。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。