AI News HubLIVE
サイト内リライト2 分で読了

因果ビデオモデルはデータ効率的なロボットポリシー学習者

Rhoda AI は、ロボット制御をビデオ生成として再定義するDirect Video-Action Model(DVA)を提案。ウェブスケールのビデオ事前学習を活用し、データ効率の良いタスク学習、長期的な視覚記憶、ワンショット学習、解釈可能性を実現。約10時間のロボットデータのみで複雑な長期タスクを実行し、単一のデモから文脈内学習が可能。

ソースHacker News AI著者: e_iris

Rhoda AIの研究者らは、Direct Video-Action Model(DVA)と呼ばれる新しいロボット制御パラダイムを提案しました。これはロボットポリシーをビデオ生成問題として再定義するものです。このモデルは、大規模なウェブビデオを用いた事前学習により、ロボットに豊富な物理世界の知識を付与し、ごく少数のロボット専用データで新しいタスクを効率的に学習することを可能にします。

従来の視覚-言語-行動モデルとは異なり、DVAは因果ビデオモデルを用いて将来のフレームを直接予測し、その後、小型の逆力学モデルが予測されたビデオをロボットの動作に変換します。この設計により、モデルは本来長いコンテキストの視覚記憶を持ち、数百フレームの視覚情報を処理して複雑なエンドツーエンドのマルチステップタスクを調整できます。さらに、長いコンテキストはワンショット学習も可能にします。つまり、ロボットはテスト時に単一の人間のデモンストレーションからコンテキスト内で行動を模倣できます。

因果ビデオモデルを効率的に訓練するために、研究者らは「Context Amortization」戦略を導入しました。この戦略では、訓練中に長いシーケンスの各時点で将来のフレーム予測を行います。これは言語モデルの次のトークン予測に類似しています。これにより、モデルは同時に数百フレームのコンテキストで訓練でき、訓練効率が大幅に向上します。同時に、KVキャッシュ技術により推論時にエンコードされたコンテキストが再利用され、計算の冗長性が最小化されます。

逆力学モデルはDVAのもう一つの重要な構成要素です。これは生成されたビデオを具体的なエンドエフェクタの動作に変換する役割を担います。ビデオ生成が複雑な意思決定部分を既に処理しているため、逆力学はより制約された問題となり、わずか約10時間のロボットデータで訓練可能です。注目すべきことに、このデータは高品質なタスクデモンストレーションである必要すらなく、ランダムな動きでも逆力学モデルの訓練に使用できます。

リアルタイムの閉ループ制御を実現するために、研究者らは「Leapfrog Inference」戦略を設計しました。モデルは次の推論のレイテンシをカバーするのに十分な長さの将来フレームを一度に予測し、同時に現在実行中の動作を条件付けることで軌跡の連続性を確保します。この戦略により、物理世界でのロボットのリアルタイム応答が保証されます。

まとめると、DVAモデルはロボット制御をビデオ生成に単純化することで、データ効率的で解釈可能かつスケーラブルなロボット学習を実現します。ビデオデータはロボットインタラクションデータセットよりもはるかに大規模に存在するため、このアプローチは汎用ロボティクスへの明確なスケーリングパスを提供します。