LeRobot v0.6.0 が正式にリリースされました。今回のアップデートは、ロボット学習ループを閉じることに焦点を当てています:ポリシーは行動前に未来を想像し、報酬モデルは成功を判断し、デプロイメントCLIは失敗をトレーニングデータに変換し、6つの新しいシミュレーションベンチマークが総合評価を可能にします。さらに、深度センシング、VLM駆動のデータセットアノテーション、カスタムビデオエンコーディング、クラウドトレーニング、より軽量なインストールも実現しました。
世界モデル:未来を想像するポリシー
VLA-JEPA は、コンパクトなVLA(Qwen3-VL-2Bベース)内でJEPA世界モデルを訓練し、潜在空間で未来のフレームを予測します。推論時には世界モデルを破棄するため、追加コストはゼロです。LingBot-VA は自己回帰ビデオアクションモデルで、未来のビデオとアクションをチャンク単位で予測し、リアルタイムで観測をフィードバックします。1つの24~32GB GPUで動作します。FastWAM は約5Bのビデオ生成エキスパートとコンパクトなアクションエキスパートを組み合わせ、訓練中は「夢」を見ることを学習し、推論時には直接アクションチャンクを生成します。
VLAモデルコレクションの拡張
GR00T N1.7 はNVIDIAの新しいクロスエンボディメント基礎モデルで、Cosmos-Reason2-2B VLMとフローマッチングアクションヘッドを採用。LeRobotに統合され、ワンクリックでロードと評価が可能です。MolmoAct2 はAllen Institute for AIが開発し、完全ファインチューニングとLoRAに対応し、SO-100/101ロボットでゼロショット実行できます。EO-1、Multitask DiT、EVO1 などのモデルも追加され、さまざまなパラメータ規模と用途をカバーします。
報酬モデル:ロボットの成功を判断
統一報酬モデルAPI(lerobot.rewards)には4つのモデルが含まれます:Robometer は汎用事前学習モデルで、任意のLeRobotデータセットに対してタスク進捗と成功をスコアリングでき、タスク固有の訓練は不要です。TOPReward は完全ゼロショットで、VLMの「True」トークンの対数確率を計算して成功を判定します。両方とも、フレーム単位の進捗曲線を生成するラベリングスクリプトを提供します。
データセット:より高速な読み込み、より豊富なデータ
新バージョンではカスタムビデオエンコーディングが可能になり、ハードウェアエンコーダを活用した録画が高速化。深度カメラのエンドツーエンドの記録と訓練に対応し、自動言語アノテーションCLI(lerobot-annotate)がVLMを使用してタイムスタンプ付きラベルを生成。データ読み込み速度は最大2倍向上し、サブセットサンプリングが分単位からミリ秒単位に短縮されました。
ベンチマーク:1つのCLIで全てを評価
6つの新しいシミュレーションベンチマークが追加されました:LIBERO-plus(摂動テスト)、RoboTwin 2.0(両腕操作)、RoboCasa365(365のキッチンタスク)、RoboCerebra(長期タスク)、RoboMME(記憶テスト)、VLABench(知識と推論)。すべて lerobot-eval CLI で実行でき、Dockerイメージも提供されます。
トレーニングと推論
新しいデプロイメントCLI lerobot-rollout は、人間がループ内でDAgger補正を行う機能を提供。FSDPトレーニングにより、GPUメモリを超えるモデルも処理可能。クラウドトレーニングはHF Jobsで実現。コードベースはより軽量で、インストールも高速化されました。
LeRobot v0.6.0 は、ロボット学習ツールチェーンの重要な進歩を示し、想像、評価、改善の完全なサイクルを実現します。