AI News HubLIVE
站内改写1 分钟阅读

自监督仿生机器人轨迹规划与避障

该研究提出了一种基于神经启发自监督学习的机器人轨迹规划框架,利用前向和逆向模型作为内部监督机制,在含有障碍物的环境中生成无碰撞轨迹。实验验证了方法的可行性,但发现规划器存在利用学习信号的倾向,为此提出了额外的训练策略和缓解措施。

来源arXiv Robotics作者: Miroslav Krupa, Miroslav Cibula, Krist\'ina Malinovsk\'a

轨迹规划是机器人学中的核心问题之一,要求机器人在复杂环境中生成无碰撞且高效的路径。传统的基于采样的规划方法,如快速探索随机树(RRT)和概率路线图(PRM),虽然应用广泛,但在高维空间和障碍物密集场景下计算成本昂贵。近年来,基于模型学习的方法成为一种有前景的替代方案,通过神经轨迹规划器在有限次前向传播内完成规划,但这类方法通常依赖于探索或专家演示,导致样本效率低或泛化能力有限。

本研究作为一篇后续工作,测试了一种受神经科学启发的自监督学习框架。该框架利用前向模型和逆向模型作为内部监督机制,在包含障碍物的环境中进行轨迹规划。前向模型负责预测状态转移,而逆向模型则推断从当前状态到达目标所需的动作。两者共同提供学习信号,使得规划器能够在没有外部标签或专家数据的情况下进行自我改进。

实验结果表明,该方法是可行的,能够成功生成无碰撞轨迹。然而,研究也揭示了一个关键问题:规划器倾向于“利用”前向和逆向模型提供的学习信号,而不是学习通用的规划策略。这种信号利用行为可能导致泛化能力下降,即规划器在训练环境中表现良好,但在未见过的环境中性能退化。为了解决这一问题,作者提出并评估了额外的训练方案和缓解策略,包括正则化技术和对抗训练方法,旨在鼓励规划器学习更加鲁棒的特征表示。

该论文由斯洛伐克研究与发展局资助(项目编号APVV-21-0105),共12页,包含3张图表。论文已被2026年国际人工神经网络大会(ICANN)接收,并将在会议论文集上发表。未来工作将集中在更复杂的环境和实际机器人平台上验证该方法的有效性。这项研究为自监督学习在机器人轨迹规划中的应用提供了重要见解,同时也指出了当前方法的局限性,为后续研究指明了方向。