Nvidia將40億引數世界模型部署到機器人上【每週物理AI綜述】
Nvidia在SIGGRAPH上釋出了Cosmos 3 Edge,一個40億引數的世界基礎模型,可在Jetson Thor上以約15Hz執行。同時,本週多篇研究論文和工業動態展示了機器人AI領域的快速發展,包括Xiaomi-Robotics-1、RoboTTT等。
本週的物理AI領域迎來了一系列重要進展。Nvidia在SIGGRAPH大會上釋出了Cosmos 3 Edge,這是一個擁有40億引數的世界基礎模型,採用混合Transformer架構,結合自迴歸推理器和擴散生成器,能夠生成動作片段。據Nvidia報告,該模型在Jetson Thor上以640×360解析度、每次推理32個動作的情況下,執行頻率約為15Hz。它可泛化應用於人形機器人、機械臂和駕駛場景。此次釋出包括開源權重、一個在DROID資料集上經過後訓練用於拾取放置任務的Cosmos-3-Edge-Policy模型,以及用於適配使用者自定義設定的後訓練指令碼。然而,一個懸而未決的問題是:這個足夠小的邊緣模型是否能夠直接驅動策略,而不僅僅是作為規劃器或離線評估器。
在研究方面,Xiaomi-Robotics-1在超過10萬小時的UMI軌跡上預訓練了一個混合Transformer VLA模型,利用VLM自動標註場景狀態轉換,並報告了清晰的縮放曲線,這些曲線在真實機器人評估中得到了驗證。該模型在RoboCasa365基準上達到了57.6%的準確率,相比之前的46.6%有顯著提升,不過程式碼和權重尚未公開。
Nvidia GEAR和Jim Fan團隊提出的RoboTTT將測試時訓練融入機器人策略,將視覺運動上下文長度擴充套件到8000個時間步,且不增加推理延遲。在長時多階段任務中,該方法取得了87%的效能提升。其核心論點在於,預訓練上下文長度可以成為機器人基礎模型的一個清潔縮放軸。
來自Yann LeCun和Lerrel Pinto團隊的Patch Policy摒棄了完整的VLM骨幹網路,而是透過塊因果掩碼將策略密集的預訓練ViT補丁令牌輸入模型。該方法在保持大規模視覺預訓練優勢的同時,僅使用約0.7%的引數,便比微調後的OpenVLA-OFT高出18%。這種高效性使得實驗室可以直接採用。
斯坦福大學Fei-Fei Li團隊提出的Masked Visual Actions將動作表示為影片中任何實體的部分揭示軌跡,使得一個微調的影片檢查點可同時作為前向模型、策略評估器和逆模型。該模型在15小時的掩碼示例上訓練,其生成的想象軌跡與實際執行的相關性足夠高,可用於評估。
CMU Guanya Shi團隊的WANDA方法從單個真實RGBD演示開始,使用高斯潑濺重建場景,然後透過全身運動規劃重新排列接觸密集的片段,合成跨新佈局和環境的逼真訓練資料。基於該方法訓練的策略能夠從單次演示中泛化到不同空間和環境,作者還展示了零樣本遷移到不同形態的移動機械手。該模型效能優於在50個遙操作演示上訓練的策略。
微軟研究院釋出的Open-AoE是一個約2000小時的以自我為中心的運算元據集,由500多名貢獻者使用400多部手機收集,包含手部姿態、相機軌跡和時間定位的原子動作。該資料集附帶完整的採集到訓練流程以及跨實體重新定位工具鏈,對於任何進行人類影片資料操作的人來說都是可複用的部分。
InternRobotics提出了REAL,一個代理型移動操作框架,具有模擬到現實一致的API和一個用於意圖消歧的模擬使用者,同時釋出了REAL-Bench,一個包含241個任務的基準測試,涵蓋探索、視覺干擾和鉸接操作。在互動任務中,REAL在封閉VLM下達到了56.9%的成功率,在60個真實世界場景中達到了78.3%,程式碼已開源。
Sunday Robotics預覽了其家用機器人模型ACT-2,聲稱在785次嘗試中,以99.1%的零樣本成功率跨不同家庭摺疊衣物,並且單個微調示例即可教會一種能泛化的行為。更值得關注的是他們提出的名為Solve的評估標準,即在宣告範圍內以給定的適應成本實現可靠效能。不過,這些資料來自公司部落格,未提供論文或權重。
快速概覽:RoboInter1.5——包含23萬條軌跡的密集中間表徵套件,以及VQA基準和世界模型;MEVION——開源雙臂遙操作平臺(60 Nm,約1.4萬美元);Grabette——約490歐元的開源手持抓取器,可透過瀏覽器SLAM流水線將野外演示記錄為標準LeRobot資料集;DiMaS——無訓練、推理時引導的流匹配VLA方法;LIFT——後訓練階段將反應式力記憶專家嫁接至預訓練VLA;IMPACT——USC提出的VLM規劃器,推理可接受接觸而非避免所有碰撞;DriftWorld——動作條件世界模型,單次生成未來幀,速度比擴散基線快約17倍。
工業方面:Fei-Fei Li的空間智慧公司World Labs收購了機器人模擬初創公司SceniX,並吸納其創始人Yunzhu Li和Changxi Zheng,致力於縮小真實與模擬之間的差距。Travis Kalanick的機器人公司Atoms融資17億美元,由a16z領投,用於重工業自動化,並收購了工業車輛公司Pronto。英國公司Humanoid完成1.52億美元A輪融資,Generative Bionics推出了全身觸覺人形機器人Gene.01,並計劃開源。
值得關注:IROS 2026將於9月27日至10月1日在匹茲堡舉行;Xiaomi-Robotics-1和RoboInter1.5尚未兌現權重開源承諾;SIGGRAPH後,可關注Cosmos 3 Edge的第三方執行和NVIDIA新發布的LeRobot整合。