跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

LeRobot v0.6.0:想象、評估、改進

文章摘要

LeRobot v0.6.0 引入了世界模型策略(VLA-JEPA、FastWAM、LingBot-VA),新一批VLA模型(GR00T N1.7、MolmoAct2等),獎勵模型API(Robometer、TOPReward),六個新仿真基準,以及部署CLI、深度感知、數據集註解加速等功能,旨在閉環機器人學習循環。

LeRobot v0.6.0:想象、評估、改進
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

LeRobot v0.6.0 正式發佈,本次更新聚焦於閉環機器人學習循環:策略能夠想象未來再行動,獎勵模型判斷成功與否,部署CLI將失敗轉化為訓練數據,並新增六個仿真基準進行全方位評估。此外,還帶來了深度感知、VLM驅動的數據集註解、自定義視頻編碼、雲端訓練和更精簡的安裝體驗。

世界模型:想象未來的策略

VLA-JEPA 在緊湊型VLA(基於Qwen3-VL-2B)中訓練JEPA世界模型,使其能在潛在空間中預測未來幀,推理時則丟棄世界模型,實現零額外成本的監督。LingBot-VA 則通過自迴歸視頻-動作模型逐塊預測未來視頻和動作,並實時反饋真實觀測,可在單塊24-32GB GPU上運行。FastWAM 結合約5B視頻專家和緊湊動作專家,訓練時學習“做夢”,推理時直接去譟動作塊。

VLA模型庫持續擴充

GR00T N1.7 是NVIDIA的新一代跨具身基礎模型,採用Cosmos-Reason2-2B+VLM和流匹配動作頭,現已集成至LeRobot,支持一鍵加載和評估。MolmoAct2 由艾倫人工智能研究所開發,支持全參數和LoRA微調,可在SO-100/101機器人上零樣本運行。EO-1、Multitask DiT 和 EVO1 等更多模型也加入支持,覆蓋不同參數量和應用場景。

獎勵模型:判斷機器人的成功

統一獎勵模型API(lerobot.rewards)包含四種模型:Robometer 是通用預訓練模型,能對任意LeRobot數據集進行任務進度和成功評分,無需任務特定訓練;TOPReward 則實現完全零樣本,通過計算VLM對“True” token的對數概率來判定成功。兩者均提供標註腳本,可生成逐幀進度曲線。

數據集:更快加載,更豐富數據

新版本支持自定義視頻編碼,可通過硬件編碼器加速錄製。深度相機支持端到端記錄和訓練,自動語言註解CLI(lerobot-annotate)能利用VLM為數據集生成時間戳標註。數據加載速度提升高達2倍,子集採樣時間從分鐘級降至毫秒級。

基準:單一CLI評估所有

新增六個仿真基準:LIBERO-plus(擾動測試)、RoboTwin 2.0(雙臂操作)、RoboCasa365(365個廚房任務)、RoboCerebra(長時任務)、RoboMME(記憶測試)、VLABench(知識與推理)。所有基準均可通過 lerobot-eval CLI 運行,並提供Docker鏡像。

訓練與推理

部署新CLI lerobot-rollout 支持人類在環DAgger修正,FSDP訓練可處理超顯存模型,雲端訓練通過HF Jobs實現。代碼庫更精簡,安裝更快。

LeRobot v0.6.0 標誌着機器人學習工具鏈的又一次重大進步,從想象、評估到改進,形成了一個完整的循環。

展開要點與分析

文章情報

工程師進階

要點

  • 新增三種世界模型策略,使機器人能夠通過想象未來輔助決策。
  • 集成GR00T N1.7、MolmoAct2等VLA模型,支持微調和部署。
  • 引入獎勵模型API,實現通用成功檢測和零樣本評估。
  • 數據集支持深度相機、自動語言註解和2倍速加載。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。