LeRobot v0.6.0 正式釋出,本次更新聚焦於閉環機器人學習迴圈:策略能夠想象未來再行動,獎勵模型判斷成功與否,部署CLI將失敗轉化為訓練資料,並新增六個模擬基準進行全方位評估。此外,還帶來了深度感知、VLM驅動的資料集註解、自定義影片編碼、雲端訓練和更精簡的安裝體驗。
世界模型:想象未來的策略
VLA-JEPA 在緊湊型VLA(基於Qwen3-VL-2B)中訓練JEPA世界模型,使其能在潛在空間中預測未來幀,推理時則丟棄世界模型,實現零額外成本的監督。LingBot-VA 則透過自迴歸影片-動作模型逐塊預測未來影片和動作,並即時反饋真實觀測,可在單塊24-32GB GPU上執行。FastWAM 結合約5B影片專家和緊湊動作專家,訓練時學習“做夢”,推理時直接去譟動作塊。
VLA模型庫持續擴充
GR00T N1.7 是NVIDIA的新一代跨具身基礎模型,採用Cosmos-Reason2-2B+VLM和流匹配動作頭,現已整合至LeRobot,支援一鍵載入和評估。MolmoAct2 由艾倫人工智慧研究所開發,支援全引數和LoRA微調,可在SO-100/101機器人上零樣本執行。EO-1、Multitask DiT 和 EVO1 等更多模型也加入支援,覆蓋不同引數量和應用場景。
獎勵模型:判斷機器人的成功
統一獎勵模型API(lerobot.rewards)包含四種模型:Robometer 是通用預訓練模型,能對任意LeRobot資料集進行任務進度和成功評分,無需任務特定訓練;TOPReward 則實現完全零樣本,透過計算VLM對“True” token的對數機率來判定成功。兩者均提供標註指令碼,可生成逐幀進度曲線。
資料集:更快載入,更豐富資料
新版本支援自定義影片編碼,可透過硬體編碼器加速錄製。深度相機支援端到端記錄和訓練,自動語言註解CLI(lerobot-annotate)能利用VLM為資料集生成時間戳標註。資料載入速度提升高達2倍,子集取樣時間從分鐘級降至毫秒級。
基準:單一CLI評估所有
新增六個模擬基準:LIBERO-plus(擾動測試)、RoboTwin 2.0(雙臂操作)、RoboCasa365(365個廚房任務)、RoboCerebra(長時任務)、RoboMME(記憶測試)、VLABench(知識與推理)。所有基準均可透過 lerobot-eval CLI 執行,並提供Docker映象。
訓練與推理
部署新CLI lerobot-rollout 支援人類在環DAgger修正,FSDP訓練可處理超視訊記憶體模型,雲端訓練透過HF Jobs實現。程式碼庫更精簡,安裝更快。
LeRobot v0.6.0 標誌著機器人學習工具鏈的又一次重大進步,從想象、評估到改進,形成了一個完整的迴圈。