小米机器人-1:基于超过10万小时真实世界轨迹的视觉-语言-动作模型规模化
小米机器人团队提出Xiaomi-Robotics-1,一个基础视觉-语言-动作(VLA)模型,能够遵循多样语言指令在未见环境中执行移动操作任务,并通过少量微调数据高效适应新任务。模型采用两阶段训练:预训练阶段利用超过10万小时的真实操作轨迹(通过UMI设备收集)赋予模型广泛的动作生成能力,并开发了可扩展的自动标注流水线;后训练阶段对齐机器人本体和人类指令。实验证明模型具有强扩展性,在RoboCasa365上达到57.6%的成功率,在RoboDojo上取得20.07的平均分,均超越先前最佳水平。代码和模型将开源。
小米机器人团队近日发布了Xiaomi-Robotics-1,这是一个基础性的视觉-语言-动作(VLA)模型,旨在通过语言指令实现广泛的移动操作任务。该模型的核心优势在于其强大的泛化能力:在未见过的环境中无需额外训练即可执行任务,同时能够通过少量微调数据高效适应新的下游任务。
为了实现这一目标,研究团队提出了一种两阶段训练方案。第一阶段是预训练,模型在超过10万小时的真实世界操作轨迹上训练,这些轨迹通过UMI设备收集。关键创新在于开发了一种可扩展的自动标注流水线,该流水线能够为轨迹片段自动生成描述场景状态转换的自然语言,从而为动作学习提供丰富且精确的条件信号。第二阶段是后训练,旨在将预训练获得的能力与机器人本体以及人类自然使用的命令式指令对齐。
实验结果表明,Xiaomi-Robotics-1展现出强烈的扩展行为。随着预训练数据规模和模型大小的增加,模型性能持续提升,并且这种扩展行为直接迁移到后训练阶段——更强的预训练模型在未见环境中带来更好的零样本真实机器人性能。此外,该模型作为一个强大的机器人基础策略,在复杂灵巧任务上可以通过高效微调实现优异表现。
在多个仿真基准测试中,Xiaomi-Robotics-1均超越了现有最先进方法。在RoboCasa365上,它实现了57.6%的成功率,大幅超越此前最佳成绩46.6%;在RoboDojo上,平均得分达到20.07,显著高于之前的13.07。这些成果证明了该模型在机器人操作领域的巨大潜力。
小米机器人团队表示,代码和模型检查点将陆续开源,以促进机器人社区的研究与开发。项目页面已上线,提供更多详细信息。