本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

MolmoMotion:言語指導による3D動作予測

記事の要約

MolmoMotionは、ビデオフレーム、オブジェクト上の3D点、および言語指示から、数秒後の3D点軌跡を予測する新しい3D動作予測モデルです。ロボット計画や制御可能なビデオ生成で既存手法を凌駕します。最大のデータセットMolmoMotion-1MとベンチマークPointMotionBenchも公開しています。

MolmoMotion:言語指導による3D動作予測
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

MolmoMotionは、アレン人工知能研究所(Ai2)が開発した革新的な3D動作予測モデルです。従来の動作認識モデルとは異なり、物体の将来の動きを予測することに焦点を当てています。ビデオフレーム、物体上の3D点、および自然言語の指示を組み合わせて、数秒後の物体点の3D位置変化を予測し、既存手法を大幅に凌ぐ性能を達成しています。

動作認識は本質的に回顧的であり、既に発生した動きを説明するものです。しかし、多くのシステムやアプリケーションは未来を見据える必要があります。例えば、ロボットがカップに手を伸ばす際には、接触する前にカップの動きを予測しなければなりません。また、ビデオ生成モデルは物理的に妥当なフレームを生成するために、次のリアルな動きを知る必要があります。MolmoMotionはこの課題に取り組むために開発されました。RGBビデオ、物体上のクエリポイント、および動作記述(例:「テーブルの上のフルーツ入りの木製ボウルを動かして回転させる」)を与えると、数秒後の3D空間での点の軌跡を予測します。

MolmoMotionは、物体に付着した3D世界空間の点を用いた効率的な動作表現を採用しています。この表現には3つの重要な特性があります:クラス非依存(人体、手、剛体などの固定テンプレートに依存しない)、ビュー安定性(同じ物理的動きがカメラや視点に関わらず一貫して表現される)、および下流システムでの直接利用可能性(ロボットポリシーやビデオ生成モデルに直接渡せる)。スパースな表面点集合は、剛体、関節物体、および限定的に変形可能な物体の動きを、物体の種類を仮定せずに記述できます。

モデルはMolmo 2をバックボーンとし、言語指示と画像内の物体や点を関連付けます。短期間のビデオ履歴、動作記述、および初期3D位置を持つクエリ点のセットを与えると、まず指示された物体と点を特定し、各点の将来の3D軌跡を予測します。2つのバリアントが訓練されています:自己回帰型(MolmoMotion-AR)は将来の座標を段階的に予測し、経路が明確な場合に最適です。フローマッチング型(MolmoMotion-FM)は連続3D空間でノイズを動作に変換し、複数の可能性がある不確実性を扱うのに適しています。

訓練と評価のために、研究チームはMolmoMotion-1Mデータセットを構築しました。これは116万のビデオから抽出された、動作記述付きの物体3D点軌跡としては最大のコレクションで、736種類の動作と5600種類の物体をカバーします。自動パイプラインを開発し、非制約ビデオから物体に関連する3D軌跡を抽出し、ノイズフィルタリング、軌跡平滑化、有意な動きの区間クリッピングを行いました。同時に、PointMotionBenchベンチマークを公開しました。これは2700のクリップから成り、111の物体カテゴリと61の動作タイプをカバーし、3D動作予測の精度を定量的に評価します。

実験結果は、PointMotionBenchにおいてMolmoMotionが既存の全手法(ピクセル空間ビデオ生成器、パラメトリック3D手法、等速ベースラインなど)を上回ることを示しました。下流タスクでは、ロボット操作において優れた性能を発揮しました。シミュレーションでは、MolmoMotionに基づく制御ポリシーがピックアンドプレイスタスクで76.3%の成功率を達成し、Molmo 2ベースの56.0%を上回り、学習速度も速く、10K訓練ステップで51%に達したのに対し、Molmo 2バージョンは19%で頭打ちでした。実際のロボットでは、MolmoMotionはわずか約2Kステップで、Molmo 2ベースラインが12Kステップ後に達成するテストL2誤差に達しました。ビデオ生成では、MolmoMotionの予測軌跡を画像からビデオへのモデルに与えることで、特に小さく正確な動きにおいて、生成ビデオの動作品質が向上し、5つの動作関連メトリクスすべてでベースモデルを上回り、より大規模なモデルにも4/5で勝りました。

ただし、MolmoMotionには限界もあります。訓練時に1物体あたり8点のみを使用するため、表面形状を密に表現できず、複雑な変形動作の処理が制限されます。研究チームは、動作予測は機械知能にとって基本的であり、MolmoMotionはその重要な一歩であると述べています。モデルウェイト、データセット、ベンチマークはオープンに公開され、コミュニティによる研究と改善が期待されています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • MolmoMotionは言語指示で3D動作予測を誘導し、既存手法を大幅に上回る性能を達成。
  • 自己回帰型とフローマッチング型の2種類のバリアントを提供。
  • データセットMolmoMotion-1Mは116万動画、736種類の動作を含む。
  • ロボット計画やビデオ生成タスクへの高い転移可能性を示す。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。