本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

JAMB:双腕マニピュレーションのための動作・運動ジョイント拡散

記事の要約

研究者らは、双腕の動作と将来の3D点軌跡を共有Transformer内で同時にノイズ除去する拡散ポリシーJAMBを提案。マルチモーダル表現を共通の時空間座標系に接地することで、動作仮説と運動仮説がノイズ除去過程で相互に洗練し合う。RoboTwin 2.0の16タスクで平均成功率83.4%を達成し、最強ベースラインを23.9ポイント上回った。実機3タスクでは、動作のみの手法と補助幾何予測手法をそれぞれ50.0ポイント、21.2ポイント上回り、散らかった場面や分布外背景への汎化も向上した。

ソースarXiv Robotics著者: Chuyang Xiao, Peilin Meng, David Held
JAMB:双腕マニピュレーションのための動作・運動ジョイント拡散
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

双腕の協調マニピュレーションが難しいのは、どちらか一方の腕の動きが共有された3Dシーンを変化させ、もう一方の腕の動作に影響を与えるからだ。しかし、多くの拡散ポリシーは将来の幾何学的影響を明示的にモデル化せずに行動を生成しており、予測型の手法でも将来状態を補助的な監督や固定条件として使うにとどまっている。この限界に対処するため、論文はJAMBを提案する。JAMBは、双腕の行動と将来の3D点軌跡を同時にノイズ除去する拡散ポリシーである。

JAMBの中心的な設計は、行動仮説と軌跡仮説を同一の共有Transformer内で一緒に進化させる点にある。ノイズ除去の各段階で、両者が互いに情報を与え、洗練し合う。さらに研究チームは、マルチモーダル表現を共通の時空間座標系に接地し、同時ノイズ除去の過程で幾何認識型の相互作用を可能にした。この共同モデリングにより、ポリシーは行動を生成するだけでなく、その行動がシーン幾何をどう変えるかも予測できる。

評価はRoboTwin 2.0の多様な双腕操作タスクと実機ロボットで行われた。比較対象は、行動のみを生成するポリシーと、異なる状態表現や学習目的を用いる代替の将来予測手法である。16のシミュレーションタスクでJAMBは平均成功率83.4%を達成し、最強のベースラインを23.9ポイント上回った。実世界の3タスクでは、行動のみの手法と補助幾何予測手法をそれぞれ50.0ポイント、21.2ポイント上回った。

性能向上に加え、JAMBは散らかったシーンや分布外背景への汎化でも評価したベースラインを上回った。著者らは、これらの結果が協調双腕操作における動作・運動ジョイントモデリングの有効性を示していると述べている。論文はChuyang Xiaoら3名によるもので、2026年9月21日にarXivへ投稿された。arXiv番号は2609.25322、分野はロボティクス(cs.RO)である。プロジェクトサイトはhttps://jam-bimanual.github.io/ で公開されている。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 双腕動作と将来の3D点軌跡を共有Transformerで同時にノイズ除去し、相互に精度を高める。
  • マルチモーダル表現を共通の時空間座標系に接地し、幾何認識型の相互作用を可能にする。
  • RoboTwin 2.0の16シミュレーションタスクで平均成功率83.4%、最強ベースラインを23.9ポイント上回る。
  • 実機3タスクで動作のみ/補助幾何予測ベースラインを50.0/21.2ポイント上回り、汎化性能も向上。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。