地形一致的参考引导强化学习实现人形机器人自主导航
本文提出一种训练人形机器人参考引导感知强化学习运动策略的方法,在训练中根据地形几何调整参考轨迹。该方法在强化学习训练循环内合成SE(2)可控参考轨迹,将期望的脚步投影到有效立足点,并调整摆动脚和质心轨迹以适应地形。在仿真中,地形条件参考显著提升了跟踪性能。在硬件上,集成MPC+控制障碍函数规划器,在Unitree G1机器人上实现了超过70米的长距离闭环自主导航,穿越崎岖地形和连续楼梯,所有感知和计算均在板载完成。
研究人员提出了一种训练人形机器人参考引导感知强化学习运动策略的新方法,该方法在训练过程中根据地形几何调整参考轨迹。该工作旨在将方法部署到标准导航自主基础设施中,通过在强化学习训练循环内合成SE(2)可控参考轨迹,将期望的脚步投影到有效立足点,并调整摆动脚和质心轨迹以适应地形。最终策略提供了干净的SE(2)速度接口,兼容标准导航规划器。在仿真中,与环境无关的参考相比,地形条件参考显著提升了参考跟踪性能。在硬件实验中,研究人员将策略与MPC(模型预测控制)和控制障碍函数规划器集成,在Unitree G1机器人上演示了长距离(超过70米)闭环自主导航,穿越包含崎岖地形和连续楼梯的室外环境,所有感知和计算均在板载完成。该论文共有8页,包含4张图,拟投稿至Humanoids 2026会议。研究结果表明,这种地形一致的训练方法能够有效提升人形机器人在复杂环境中的自主导航能力,为未来在搜救、勘探等领域的应用奠定了基础。此外,该方法通过合成SE(2)可控参考轨迹,使得机器人能够根据地形实时调整脚步和重心,从而在凹凸不平的地面和楼梯上保持平衡。MPC与控制障碍函数的结合进一步确保了导航的安全性和鲁棒性。所有感知和计算均在机器人板载计算机上完成,无需外部处理,显示了实际部署的可行性。作者来自相关研究机构,论文已提交至Humanoids 2026,有望推动人形机器人自主导航技术的发展。