因果视频模型是数据高效的机器人策略学习者
Rhoda AI 提出直接视频-动作模型(DVA),将机器人控制重新定义为视频生成,利用网络视频预训练实现数据高效的任务学习、长期上下文记忆、一次性学习和可解释性。该模型通过因果视频模型和逆动力学模型,在仅需约10小时机器人数据的情况下完成复杂任务,并支持从单一演示中上下文学习。
Rhoda AI 的研究人员提出了直接视频-动作模型(Direct Video-Action Model, DVA),这是一种全新的机器人控制范式,将机器人策略重新定义为视频生成问题。该模型利用大规模网络视频进行预训练,从而赋予机器人丰富的物理世界知识,使其能够以极少的机器人专用数据高效学习新任务。
与传统的视觉-语言-动作模型不同,DVA 通过因果视频模型直接预测未来帧,再使用小型逆动力学模型将预测的视频转换为机器人动作。这种设计使得模型天然具备长上下文视觉记忆,能够处理数百帧的视觉信息,从而协调复杂的端到端多步骤任务。此外,长上下文还解锁了一次性学习能力:机器人可以在测试时从单个人类演示中上下文模仿行为。
为了高效训练因果视频模型,研究人员引入了“上下文摊销”策略。该策略在训练时对长序列中的每个时间点都进行未来帧预测,类似于语言模型中的下一个token预测。这使得模型能够同时在数百帧的上下文中进行训练,大大提高了训练效率。同时,KV缓存技术在推理时重复利用编码的上下文,减少了计算冗余。
逆动力学模型是DVA的另一个关键组成部分。它负责将生成的视频翻译为具体的末端执行器动作。由于视频生成已经处理了复杂的决策部分,逆动力学成为一个更加约束的问题,仅需约10小时的本体类型数据即可训练。值得注意的是,这些数据甚至不需要高质量的任务演示,随机运动也足以训练逆动力学模型。
为了实现实时闭环控制,研究人员设计了“蛙跳推理”策略:模型一次预测足够长的未来帧,以覆盖下一次推理的延迟,同时通过条件化当前执行的动作来确保轨迹连续性。该策略保证了机器人在物理世界中的实时响应。
总之,DVA 模型通过将机器人控制简化为视频生成,实现了数据高效、可解释、可扩展的机器人学习。由于视频数据在网络上的规模远大于机器人交互数据集,该方法为通用机器人技术提供了清晰的规模化路径。