AI News HubLIVE
站内改写1 分钟阅读

RLMM-Flow:一种基于流模型的移动操控框架与潜在空间强化学习

RLMM-Flow提出了一种结合专家流策略预训练与潜在空间强化学习后训练的移动操控框架。该框架首先从专家演示中学习多模态全身运动先验,然后冻结预训练流策略,通过潜在引导网络将初始噪声导向高价值动作块。实验表明,该方法在任务成功率、避障和轨迹质量上显著优于纯模仿学习流策略。

来源arXiv Robotics作者: Shuhang Wang, Ziming Li, Hui Cheng

移动操控机器人需要生成全身动作块,这些动作块必须同时满足目标到达、避障、基座运动学约束、机械臂关节限位以及轨迹平滑性等多重要求。流模型作为一种生成式策略,能够从专家演示中学习多模态且时间一致的运动先验,但仅靠模仿学习无法超越演示数据的分布,导致策略质量受限。为此,由Shuhang Wang等人提出的RLMM-Flow框架,将专家流策略预训练与潜在空间强化学习后训练相结合,旨在突破这一限制。

该框架首先通过流模型学习一个多模态的全身运动先验,该先验捕捉了专家演示中的多样化运动模式。预训练完成后,流策略被冻结,而一个潜在引导网络负责将初始噪声向量引导至产生高价值动作块的区域。为了稳定高维潜在空间的优化过程,研究者先预热一个动作空间评判器(critic),然后联合训练潜在评判器和潜在演员(actor),并引入了从粗到细的潜在引导机制:从水平共享的潜在表示逐步扩展到全维残差表示。这种渐进式扩展使得控制更加精细,同时避免了高维优化中的不稳定问题,这是该工作的关键创新之一。

在多个移动操控运动规划基准上的实验结果表明,RLMM-Flow在任务成功率、避障能力和轨迹质量方面均显著优于纯模仿学习的流策略以及现有的强化学习后训练基线。例如,在需要精确躲避动态障碍物的任务中,RLMM-Flow的成功率提升了约20%,同时生成的轨迹更加平滑,符合运动学约束。更重要的是,该方法保留了流模型快速推理的优势,使得实时应用成为可能。该论文于2026年7月29日提交至arXiv,作为首个将流模型与潜在空间强化学习相结合用于移动操控的工作,为机器人领域提供了一种高效且可扩展的解决方案,有望推动机器人在家庭、仓储等复杂环境中的自主操作能力。