跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

通过深度强化学习实现人类陪伴机器人的自适应交互策略

文章摘要

一篇已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收的论文,提出用深度强化学习让移动机器人在陪伴行人时动态调整自身跟踪位置,并融合模型预测路径积分控制与控制障碍函数来兼顾精准跟随、避障与安全。室内外真实场景实验显示,该方法将任务成功率与跟踪精度分别至少提升 24% 与 47%,并能在行人速度最高 1.7 m/s 的情况下灵活伴行、提升人的舒适度。

来源arXiv Robotics作者: Cong-Thanh Vu, Yen-Chen Liu
通过深度强化学习实现人类陪伴机器人的自适应交互策略
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

在人类与机器人交互(HRI)研究中,机器人能否在真实环境里灵活地陪伴人类行走,被认为是极具应用潜力的方向,但同时也是一大难题。既有做法通常把机器人绑定在相对人的某个固定方位上——例如始终跟在身后、走在身前或与人并排——这种设定在人员流动、障碍物变化的动态工作空间里很快就显得僵化,机器人的适应性因此受到明显限制。

针对这一问题,这篇论文提出了一种新的人类伴行策略,核心是用深度强化学习(DRL)让移动机器人依据不断变化的环境条件,动态决定自己应当处于什么跟踪位置。研究定义了一个“交互空间”,用来刻画人与机器人之间、并同时考虑周围环境的关系;这一交互空间随后成为 DRL 状态空间的基础,使机器人能够感知并适应环境变化,而不是死守某一个预设方位。在控制层面,作者把模型预测路径积分(MPPI)控制与控制障碍函数(CBF)结合起来,构建出人—机器人伴行控制器。该控制器一方面保证机器人在位置和朝向上都能准确跟随目标人物的运动,另一方面兼顾障碍物规避,从而提升社会接受度与安全性。

评估工作在真实的室内与室外场景中完成,并与其它研究进行了对比。结果显示,所提方法在任务成功率和跟踪精度上分别至少提升了 24% 和 47%,同时也改善了人类伙伴的舒适感受。实验还验证了机器人的灵活伴行能力:当人以最高 1.7 m/s 的速度行走时,机器人能够动态调整策略,而不再被限制在某个固定位置。此外,机器人会尊重人的亲密空间,在保证安全与舒适的前提下完成有效的避障。

论文由 Cong-Thanh Vu 与 Yen-Chen Liu 完成,于 2026 年 8 月 20 日提交至 arXiv(编号 arXiv:2609.25031v1,主分类 cs.RO,交叉分类 eess.SY),数字对象标识符为 10.48550/arXiv.2609.25031。该工作已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收。需要注意的是,上述结果均来自论文摘要层面的陈述,具体算法实现、实验设置与局限仍需查阅原文全文。

展开要点与分析

文章情报

研究者进阶

要点

  • 传统伴行机器人被限制在人的后方、前方或并排等固定相对位置,难以适应动态工作空间。
  • 研究定义“交互空间”来刻画人、机器人与环境三者关系,并将其作为深度强化学习状态空间的基础。
  • 控制器结合 MPPI 与控制障碍函数(CBF),在保证位置与朝向精确跟随的同时实现避障与安全。
  • 真实室内外实验中成功率与跟踪精度分别至少提升 24% 和 47%,机器人可伴行最高 1.7 m/s 的行人。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。