本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

τ0-WM:最大規模の事前学習済みオープンソース具身世界モデルが登場

記事の要約

5Bパラメータのオープンソース具身世界モデルτ0-WMが公開された。約3万時間のデータで事前学習され、うち1.78万時間は実機遠隔操作データ。テスト時計算を導入し、ロボットが行動前に複数の候補をシミュレート・評価することで、長期的な精密操作タスクで最高性能を達成。

ソース量子位著者: 衡宇
τ0-WM:最大規模の事前学習済みオープンソース具身世界モデルが登場
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

上海創新学院の准教授であり智元ロボットのチーフサイエンティストである羅劍嵐氏が率いるチームは、これまでで最大のオープンソース事前学習済み具身世界モデル「τ0-World Model(τ0-WM)」を公開した。5Bパラメータを持つτ0-WMは、約3万時間のデータで事前学習されており、そのうち1.78万時間は実機遠隔操作データである。これは、実機データが事前学習の主要ソースとして使われた初めてのケースとなる。

τ0-WMは、反応的なエンドツーエンドポリシーとは異なり、テスト時計算を通じてロボットが行動前に「考える」ことを可能にする。オンライン推論パイプラインは、提案、シミュレーション、評価の3段階で構成される。まず、ビデオ行動モデル(VAM)が複数の候補行動と対応する未来のビデオ潜在表現を生成する。次に、行動条件付きビデオシミュレーターが各候補に対してマルチビューの未来フレームを生成する。最後に、再ノイズ除去一貫性スコア(RCS)が行動をランク付けし、トップスコアが不十分な場合、低品質行動修正(LAR)メカニズムが起動する。システムは最も有望な未来状態を選択し、それに基づいて行動を再生成する。これにより、ロボットは行動前に複数の選択肢を比較検討できる。

学習データは慎重に調整された混合データである。実機遠隔操作データ(1.78万時間)は高品質な行動監視信号を提供する。UMIデータ(6,500時間)は行動の多様性を追加するが、動作空間が一致しないため、モダリティ固有のマスクを介してビデオと行動の両方の学習に貢献する。エゴセントリックな人間のビデオ(3,000時間)にはロボットの行動ラベルがなく、ビデオブランチのみを学習し、物体のダイナミクスや相互作用パターンをモデルに学習させる。

実験では、テスト時計算の有効性が実証された。2つの新しいタスク(ティッシュを箱に入れる、ペンを箱に入れる)において、テスト時計算なしのベースラインポリシーは平均成功率43%だった。RCSを追加すると50%に向上し、さらにLARを組み込むと60%に達した。特に難しいペン入れタスクでは、成功率が30%から50%に向上した。他のガイド手法(CFG 20%、ACG 38%)との比較でもτ0-WMの優位性が示された。これは、行動の一貫性ではなく、将来のタスク進捗を評価するためである。

τ0-WMは、具身AIにおけるデータピラミッドのパラダイムシフトも示している。従来、実機データは高価すぎて事前学習には使えず、ファインチューニングのために取っておかれた。大規模な遠隔操作データとエゴセントリックビデオを組み合わせることで、チームは実機データが事前学習の燃料として機能し、学習、展開、データ収集、再学習の好循環を可能にすることを実証した。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • τ0-WMは5Bパラメータ、約3万時間の学習データを持つ最大のオープンソース事前学習済み具身世界モデル。
  • 実機遠隔操作データ(1.78万時間)が事前学習の主力となるのは業界初。
  • 提案・シミュレーション・評価の3段階パイプラインでテスト時計算を実行し、ロボットに「熟考」を可能にする。
  • 4つの長期的操作タスクでベースラインを上回り、テスト時計算によって成功率が17ポイント向上。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。