PhysBrain 1.0技术报告:从人类视频中学习物理常识以提升机器人能力
PhysBrain 1.0是一种新方法,将大规模人类自我中心视频转换为结构化物理常识知识,用于改善机器人的理解和控制。通过提取场景元素、空间动态和深度感知关系,训练视觉语言模型,然后将其适应到机器人策略中。该方法在多个具身AI基准测试中达到最先进水平,尤其在域外任务中表现出色。
近年来,视觉-语言-动作模型取得了显著进展,但仅依靠机器人轨迹数据来学习广泛的物理理解能力仍存在覆盖不足的问题。PhysBrain 1.0技术报告提出了一种补充性思路:在大规模人类自我中心视频中提取结构化的物理常识监督信号,然后在机器人适应阶段进行迁移。该研究由Shijie Lian等13位作者共同完成,相关论文已提交至arXiv(编号2605.15298)。
PhysBrain 1.0的核心是一个数据引擎,它能够从人类视频中自动提取场景元素、空间动态、动作执行过程以及深度感知关系。这些信息随后被转化为问答形式的监督数据,用于训练PhysBrain视觉语言模型(VLM)。例如,数据引擎可以识别物体之间的相对位置、运动轨迹以及人与环境的交互模式。经过训练的模型获得了物理先验知识,通过一种既保留原始能力又对语言敏感的适应设计,这些先验知识被进一步迁移到视觉-语言-动作(VLA)策略中。这种设计确保了模型在适应机器人控制时不会遗忘原有的多模态理解能力,同时能够根据自然语言指令灵活调整行为。
在多项多模态问答基准和具身控制基准测试中,PhysBrain 1.0均取得了最先进(SOTA)的结果。具体测试包括ERQA、PhysBench、SimplerEnv-WidowX、LIBERO和RoboCasa。特别值得一提的是,在SimplerEnv的域外(out-of-domain)测试中,PhysBrain 1.0表现尤为突出,显示出强大的泛化能力。这些结果表明,从人类交互视频中扩展物理常识知识,能够有效连接多模态理解与机器人动作执行,为未来机器人学习提供了一条有前景的路径。此外,研究团队还计划进一步探索如何将来自不同环境和任务的视频数据整合,以构建更通用的物理常识表示。