成本受限四足硬件上的强化学习
本文探讨在低成本四足机器人(如Mini Pupper 2)上部署强化学习策略时,超过50毫秒的传输延迟如何导致仿真与现实差距扩大。通过引入执行器延迟的前向模型和时序感知神经网络,实现了鲁棒的行走,并且网络自组织出类似脊椎动物脊髓的中枢模式生成器(CPG),对高达+320毫秒的额外延迟扰动表现出强鲁棒性。研究指出时间自组织可能是成本受限运动控制的通用策略。
在低成本四足机器人(如Mini Pupper 2)上部署基于强化学习的控制策略面临严峻挑战。由于硬件成本限制,这些平台普遍存在显著的执行器传输延迟(实验测量超过50毫秒)和电机反馈噪声,导致仿真环境与真实硬件之间的差距(sim-to-real gap)急剧扩大。这一问题将原本标准的马尔可夫决策过程转化为部分可观测过程,使得传统强化学习方法难以直接应用。为了弥合这一鸿沟,研究人员从生物系统中获得灵感,提出了一种结合执行器平均延迟前向模型与时序感知神经网络的创新方法。该前向模型为网络提供了延迟的统计信息,而时序感知神经网络则能够处理非马尔可夫特性,从噪声和延迟的反馈中提取有效信号。通过这种组合,机器人学会了鲁棒的行走策略,即使在未知延迟条件下也能保持稳定。令人惊喜的是,该时序感知神经网络在训练过程中自行涌现出一种中央模式生成器(central pattern generator, CPG)。CPG是脊椎动物脊髓中存在的神经回路,能够产生自维持的节律运动信号。在此工作中,该网络生成的CPG步态对高达+320毫秒的额外延迟扰动表现出极强的鲁棒性,模拟了自然界中生物的运动控制机制。作者指出,这种时间自组织现象可能并非偶然,而是成本受限 locomotion 问题中一种普遍有效的策略。未来,这一方法有望推广到其他低成本机器人平台,使强化学习在资源受限的硬件上发挥更大作用,推动机器人技术的普及。