AI News HubLIVE
站內改寫3 分鐘閱讀

Nvidia將40億參數世界模型部署到機器人上【每週物理AI綜述】

Nvidia在SIGGRAPH上發佈了Cosmos 3 Edge,一個40億參數的世界基礎模型,可在Jetson Thor上以約15Hz運行。同時,本週多篇研究論文和工業動態展示了機器人AI領域的快速發展,包括Xiaomi-Robotics-1、RoboTTT等。

來源Hacker News AI作者: DISCURSIVE

本週的物理AI領域迎來了一系列重要進展。Nvidia在SIGGRAPH大會上發佈了Cosmos 3 Edge,這是一個擁有40億參數的世界基礎模型,採用混合Transformer架構,結合自迴歸推理器和擴散生成器,能夠生成動作片段。據Nvidia報告,該模型在Jetson Thor上以640×360分辨率、每次推理32個動作的情況下,運行頻率約為15Hz。它可泛化應用於人形機器人、機械臂和駕駛場景。此次發佈包括開源權重、一個在DROID數據集上經過後訓練用於拾取放置任務的Cosmos-3-Edge-Policy模型,以及用於適配用户自定義設置的後訓練腳本。然而,一個懸而未決的問題是:這個足夠小的邊緣模型是否能夠直接驅動策略,而不僅僅是作為規劃器或離線評估器。

在研究方面,Xiaomi-Robotics-1在超過10萬小時的UMI軌跡上預訓練了一個混合Transformer VLA模型,利用VLM自動標註場景狀態轉換,並報告了清晰的縮放曲線,這些曲線在真實機器人評估中得到了驗證。該模型在RoboCasa365基準上達到了57.6%的準確率,相比之前的46.6%有顯著提升,不過代碼和權重尚未公開。

Nvidia GEAR和Jim Fan團隊提出的RoboTTT將測試時訓練融入機器人策略,將視覺運動上下文長度擴展到8000個時間步,且不增加推理延遲。在長時多階段任務中,該方法取得了87%的性能提升。其核心論點在於,預訓練上下文長度可以成為機器人基礎模型的一個清潔縮放軸。

來自Yann LeCun和Lerrel Pinto團隊的Patch Policy摒棄了完整的VLM骨幹網絡,而是通過塊因果掩碼將策略密集的預訓練ViT補丁令牌輸入模型。該方法在保持大規模視覺預訓練優勢的同時,僅使用約0.7%的參數,便比微調後的OpenVLA-OFT高出18%。這種高效性使得實驗室可以直接採用。

斯坦福大學Fei-Fei Li團隊提出的Masked Visual Actions將動作表示為視頻中任何實體的部分揭示軌跡,使得一個微調的視頻檢查點可同時作為前向模型、策略評估器和逆模型。該模型在15小時的掩碼示例上訓練,其生成的想象軌跡與實際執行的相關性足夠高,可用於評估。

CMU Guanya Shi團隊的WANDA方法從單個真實RGBD演示開始,使用高斯潑濺重建場景,然後通過全身運動規劃重新排列接觸密集的片段,合成跨新佈局和環境的逼真訓練數據。基於該方法訓練的策略能夠從單次演示中泛化到不同空間和環境,作者還展示了零樣本遷移到不同形態的移動機械手。該模型性能優於在50個遙操作演示上訓練的策略。

微軟研究院發佈的Open-AoE是一個約2000小時的以自我為中心的操作數據集,由500多名貢獻者使用400多部手機收集,包含手部姿態、相機軌跡和時間定位的原子動作。該數據集附帶完整的採集到訓練流程以及跨實體重新定位工具鏈,對於任何進行人類視頻數據操作的人來説都是可複用的部分。

InternRobotics提出了REAL,一個代理型移動操作框架,具有模擬到現實一致的API和一個用於意圖消歧的模擬用户,同時發佈了REAL-Bench,一個包含241個任務的基準測試,涵蓋探索、視覺干擾和鉸接操作。在交互任務中,REAL在封閉VLM下達到了56.9%的成功率,在60個真實世界場景中達到了78.3%,代碼已開源。

Sunday Robotics預覽了其家用機器人模型ACT-2,聲稱在785次嘗試中,以99.1%的零樣本成功率跨不同家庭摺疊衣物,並且單個微調示例即可教會一種能泛化的行為。更值得關注的是他們提出的名為Solve的評估標準,即在聲明範圍內以給定的適應成本實現可靠性能。不過,這些數據來自公司博客,未提供論文或權重。

快速概覽:RoboInter1.5——包含23萬條軌跡的密集中間表徵套件,以及VQA基準和世界模型;MEVION——開源雙臂遙操作平台(60 Nm,約1.4萬美元);Grabette——約490歐元的開源手持抓取器,可通過瀏覽器SLAM流水線將野外演示記錄為標準LeRobot數據集;DiMaS——無訓練、推理時引導的流匹配VLA方法;LIFT——後訓練階段將反應式力記憶專家嫁接至預訓練VLA;IMPACT——USC提出的VLM規劃器,推理可接受接觸而非避免所有碰撞;DriftWorld——動作條件世界模型,單次生成未來幀,速度比擴散基線快約17倍。

工業方面:Fei-Fei Li的空間智能公司World Labs收購了機器人仿真初創公司SceniX,並吸納其創始人Yunzhu Li和Changxi Zheng,致力於縮小真實與模擬之間的差距。Travis Kalanick的機器人公司Atoms融資17億美元,由a16z領投,用於重工業自動化,並收購了工業車輛公司Pronto。英國公司Humanoid完成1.52億美元A輪融資,Generative Bionics推出了全身觸覺人形機器人Gene.01,並計劃開源。

值得關注:IROS 2026將於9月27日至10月1日在匹茲堡舉行;Xiaomi-Robotics-1和RoboInter1.5尚未兑現權重開源承諾;SIGGRAPH後,可關注Cosmos 3 Edge的第三方運行和NVIDIA新發布的LeRobot集成。