AI News HubLIVE
站内改写3 分钟阅读

Nvidia将40亿参数世界模型部署到机器人上【每周物理AI综述】

Nvidia在SIGGRAPH上发布了Cosmos 3 Edge,一个40亿参数的世界基础模型,可在Jetson Thor上以约15Hz运行。同时,本周多篇研究论文和工业动态展示了机器人AI领域的快速发展,包括Xiaomi-Robotics-1、RoboTTT等。

来源Hacker News AI作者: DISCURSIVE

本周的物理AI领域迎来了一系列重要进展。Nvidia在SIGGRAPH大会上发布了Cosmos 3 Edge,这是一个拥有40亿参数的世界基础模型,采用混合Transformer架构,结合自回归推理器和扩散生成器,能够生成动作片段。据Nvidia报告,该模型在Jetson Thor上以640×360分辨率、每次推理32个动作的情况下,运行频率约为15Hz。它可泛化应用于人形机器人、机械臂和驾驶场景。此次发布包括开源权重、一个在DROID数据集上经过后训练用于拾取放置任务的Cosmos-3-Edge-Policy模型,以及用于适配用户自定义设置的后训练脚本。然而,一个悬而未决的问题是:这个足够小的边缘模型是否能够直接驱动策略,而不仅仅是作为规划器或离线评估器。

在研究方面,Xiaomi-Robotics-1在超过10万小时的UMI轨迹上预训练了一个混合Transformer VLA模型,利用VLM自动标注场景状态转换,并报告了清晰的缩放曲线,这些曲线在真实机器人评估中得到了验证。该模型在RoboCasa365基准上达到了57.6%的准确率,相比之前的46.6%有显著提升,不过代码和权重尚未公开。

Nvidia GEAR和Jim Fan团队提出的RoboTTT将测试时训练融入机器人策略,将视觉运动上下文长度扩展到8000个时间步,且不增加推理延迟。在长时多阶段任务中,该方法取得了87%的性能提升。其核心论点在于,预训练上下文长度可以成为机器人基础模型的一个清洁缩放轴。

来自Yann LeCun和Lerrel Pinto团队的Patch Policy摒弃了完整的VLM骨干网络,而是通过块因果掩码将策略密集的预训练ViT补丁令牌输入模型。该方法在保持大规模视觉预训练优势的同时,仅使用约0.7%的参数,便比微调后的OpenVLA-OFT高出18%。这种高效性使得实验室可以直接采用。

斯坦福大学Fei-Fei Li团队提出的Masked Visual Actions将动作表示为视频中任何实体的部分揭示轨迹,使得一个微调的视频检查点可同时作为前向模型、策略评估器和逆模型。该模型在15小时的掩码示例上训练,其生成的想象轨迹与实际执行的相关性足够高,可用于评估。

CMU Guanya Shi团队的WANDA方法从单个真实RGBD演示开始,使用高斯泼溅重建场景,然后通过全身运动规划重新排列接触密集的片段,合成跨新布局和环境的逼真训练数据。基于该方法训练的策略能够从单次演示中泛化到不同空间和环境,作者还展示了零样本迁移到不同形态的移动机械手。该模型性能优于在50个遥操作演示上训练的策略。

微软研究院发布的Open-AoE是一个约2000小时的以自我为中心的操作数据集,由500多名贡献者使用400多部手机收集,包含手部姿态、相机轨迹和时间定位的原子动作。该数据集附带完整的采集到训练流程以及跨实体重新定位工具链,对于任何进行人类视频数据操作的人来说都是可复用的部分。

InternRobotics提出了REAL,一个代理型移动操作框架,具有模拟到现实一致的API和一个用于意图消歧的模拟用户,同时发布了REAL-Bench,一个包含241个任务的基准测试,涵盖探索、视觉干扰和铰接操作。在交互任务中,REAL在封闭VLM下达到了56.9%的成功率,在60个真实世界场景中达到了78.3%,代码已开源。

Sunday Robotics预览了其家用机器人模型ACT-2,声称在785次尝试中,以99.1%的零样本成功率跨不同家庭折叠衣物,并且单个微调示例即可教会一种能泛化的行为。更值得关注的是他们提出的名为Solve的评估标准,即在声明范围内以给定的适应成本实现可靠性能。不过,这些数据来自公司博客,未提供论文或权重。

快速概览:RoboInter1.5——包含23万条轨迹的密集中间表征套件,以及VQA基准和世界模型;MEVION——开源双臂遥操作平台(60 Nm,约1.4万美元);Grabette——约490欧元的开源手持抓取器,可通过浏览器SLAM流水线将野外演示记录为标准LeRobot数据集;DiMaS——无训练、推理时引导的流匹配VLA方法;LIFT——后训练阶段将反应式力记忆专家嫁接至预训练VLA;IMPACT——USC提出的VLM规划器,推理可接受接触而非避免所有碰撞;DriftWorld——动作条件世界模型,单次生成未来帧,速度比扩散基线快约17倍。

工业方面:Fei-Fei Li的空间智能公司World Labs收购了机器人仿真初创公司SceniX,并吸纳其创始人Yunzhu Li和Changxi Zheng,致力于缩小真实与模拟之间的差距。Travis Kalanick的机器人公司Atoms融资17亿美元,由a16z领投,用于重工业自动化,并收购了工业车辆公司Pronto。英国公司Humanoid完成1.52亿美元A轮融资,Generative Bionics推出了全身触觉人形机器人Gene.01,并计划开源。

值得关注:IROS 2026将于9月27日至10月1日在匹兹堡举行;Xiaomi-Robotics-1和RoboInter1.5尚未兑现权重开源承诺;SIGGRAPH后,可关注Cosmos 3 Edge的第三方运行和NVIDIA新发布的LeRobot集成。