跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

LeRobot v0.6.0:想象、評估、改進

文章摘要

LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),獎勵模型API(Robometer、TOPReward),六個新模擬基準,以及部署CLI、深度感知、資料集註解加速等功能,旨在閉環機器人學習迴圈。

LeRobot v0.6.0:想象、評估、改進
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

LeRobot v0.6.0 正式釋出,本次更新聚焦於閉環機器人學習迴圈:策略能夠想象未來再行動,獎勵模型判斷成功與否,部署CLI將失敗轉化為訓練資料,並新增六個模擬基準進行全方位評估。此外,還帶來了深度感知、VLM驅動的資料集註解、自定義影片編碼、雲端訓練和更精簡的安裝體驗。

世界模型:想象未來的策略

VLA-JEPA 在緊湊型VLA(基於Qwen3-VL-2B)中訓練JEPA世界模型,使其能在潛在空間中預測未來幀,推理時則丟棄世界模型,實現零額外成本的監督。LingBot-VA 則透過自迴歸影片-動作模型逐塊預測未來影片和動作,並即時反饋真實觀測,可在單塊24-32GB GPU上執行。FastWAM 結合約5B影片專家和緊湊動作專家,訓練時學習“做夢”,推理時直接去譟動作塊。

VLA模型庫持續擴充

GR00T N1.7 是NVIDIA的新一代跨具身基礎模型,採用Cosmos-Reason2-2B+VLM和流匹配動作頭,現已整合至LeRobot,支援一鍵載入和評估。MolmoAct2 由艾倫人工智慧研究所開發,支援全引數和LoRA微調,可在SO-100/101機器人上零樣本執行。EO-1、Multitask DiT 和 EVO1 等更多模型也加入支援,覆蓋不同引數量和應用場景。

獎勵模型:判斷機器人的成功

統一獎勵模型API(lerobot.rewards)包含四種模型:Robometer 是通用預訓練模型,能對任意LeRobot資料集進行任務進度和成功評分,無需任務特定訓練;TOPReward 則實現完全零樣本,透過計算VLM對“True” token的對數機率來判定成功。兩者均提供標註指令碼,可生成逐幀進度曲線。

資料集:更快載入,更豐富資料

新版本支援自定義影片編碼,可透過硬體編碼器加速錄製。深度相機支援端到端記錄和訓練,自動語言註解CLI(lerobot-annotate)能利用VLM為資料集生成時間戳標註。資料載入速度提升高達2倍,子集取樣時間從分鐘級降至毫秒級。

基準:單一CLI評估所有

新增六個模擬基準:LIBERO-plus(擾動測試)、RoboTwin 2.0(雙臂操作)、RoboCasa365(365個廚房任務)、RoboCerebra(長時任務)、RoboMME(記憶測試)、VLABench(知識與推理)。所有基準均可透過 lerobot-eval CLI 執行,並提供Docker映象。

訓練與推理

部署新CLI lerobot-rollout 支援人類在環DAgger修正,FSDP訓練可處理超視訊記憶體模型,雲端訓練透過HF Jobs實現。程式碼庫更精簡,安裝更快。

LeRobot v0.6.0 標誌著機器人學習工具鏈的又一次重大進步,從想象、評估到改進,形成了一個完整的迴圈。

展開要點與分析

文章情報

工程師進階

要點

  • 新增三種世界模型策略,使機器人能夠透過想象未來輔助決策。
  • 整合GR00T N1.7、MolmoAct2等VLA模型,支援微調和部署。
  • 引入獎勵模型API,實現通用成功檢測和零樣本評估。
  • 資料集支援深度相機、自動語言註解和2倍速載入。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。