上海創新学院の准教授であり智元ロボットのチーフサイエンティストである羅劍嵐氏が率いるチームは、これまでで最大のオープンソース事前学習済み具身世界モデル「τ0-World Model(τ0-WM)」を公開した。5Bパラメータを持つτ0-WMは、約3万時間のデータで事前学習されており、そのうち1.78万時間は実機遠隔操作データである。これは、実機データが事前学習の主要ソースとして使われた初めてのケースとなる。
τ0-WMは、反応的なエンドツーエンドポリシーとは異なり、テスト時計算を通じてロボットが行動前に「考える」ことを可能にする。オンライン推論パイプラインは、提案、シミュレーション、評価の3段階で構成される。まず、ビデオ行動モデル(VAM)が複数の候補行動と対応する未来のビデオ潜在表現を生成する。次に、行動条件付きビデオシミュレーターが各候補に対してマルチビューの未来フレームを生成する。最後に、再ノイズ除去一貫性スコア(RCS)が行動をランク付けし、トップスコアが不十分な場合、低品質行動修正(LAR)メカニズムが起動する。システムは最も有望な未来状態を選択し、それに基づいて行動を再生成する。これにより、ロボットは行動前に複数の選択肢を比較検討できる。
学習データは慎重に調整された混合データである。実機遠隔操作データ(1.78万時間)は高品質な行動監視信号を提供する。UMIデータ(6,500時間)は行動の多様性を追加するが、動作空間が一致しないため、モダリティ固有のマスクを介してビデオと行動の両方の学習に貢献する。エゴセントリックな人間のビデオ(3,000時間)にはロボットの行動ラベルがなく、ビデオブランチのみを学習し、物体のダイナミクスや相互作用パターンをモデルに学習させる。
実験では、テスト時計算の有効性が実証された。2つの新しいタスク(ティッシュを箱に入れる、ペンを箱に入れる)において、テスト時計算なしのベースラインポリシーは平均成功率43%だった。RCSを追加すると50%に向上し、さらにLARを組み込むと60%に達した。特に難しいペン入れタスクでは、成功率が30%から50%に向上した。他のガイド手法(CFG 20%、ACG 38%)との比較でもτ0-WMの優位性が示された。これは、行動の一貫性ではなく、将来のタスク進捗を評価するためである。
τ0-WMは、具身AIにおけるデータピラミッドのパラダイムシフトも示している。従来、実機データは高価すぎて事前学習には使えず、ファインチューニングのために取っておかれた。大規模な遠隔操作データとエゴセントリックビデオを組み合わせることで、チームは実機データが事前学習の燃料として機能し、学習、展開、データ収集、再学習の好循環を可能にすることを実証した。