在人类与机器人交互(HRI)研究中,机器人能否在真实环境里灵活地陪伴人类行走,被认为是极具应用潜力的方向,但同时也是一大难题。既有做法通常把机器人绑定在相对人的某个固定方位上——例如始终跟在身后、走在身前或与人并排——这种设定在人员流动、障碍物变化的动态工作空间里很快就显得僵化,机器人的适应性因此受到明显限制。
针对这一问题,这篇论文提出了一种新的人类伴行策略,核心是用深度强化学习(DRL)让移动机器人依据不断变化的环境条件,动态决定自己应当处于什么跟踪位置。研究定义了一个“交互空间”,用来刻画人与机器人之间、并同时考虑周围环境的关系;这一交互空间随后成为 DRL 状态空间的基础,使机器人能够感知并适应环境变化,而不是死守某一个预设方位。在控制层面,作者把模型预测路径积分(MPPI)控制与控制障碍函数(CBF)结合起来,构建出人—机器人伴行控制器。该控制器一方面保证机器人在位置和朝向上都能准确跟随目标人物的运动,另一方面兼顾障碍物规避,从而提升社会接受度与安全性。
评估工作在真实的室内与室外场景中完成,并与其它研究进行了对比。结果显示,所提方法在任务成功率和跟踪精度上分别至少提升了 24% 和 47%,同时也改善了人类伙伴的舒适感受。实验还验证了机器人的灵活伴行能力:当人以最高 1.7 m/s 的速度行走时,机器人能够动态调整策略,而不再被限制在某个固定位置。此外,机器人会尊重人的亲密空间,在保证安全与舒适的前提下完成有效的避障。
论文由 Cong-Thanh Vu 与 Yen-Chen Liu 完成,于 2026 年 8 月 20 日提交至 arXiv(编号 arXiv:2609.25031v1,主分类 cs.RO,交叉分类 eess.SY),数字对象标识符为 10.48550/arXiv.2609.25031。该工作已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收。需要注意的是,上述结果均来自论文摘要层面的陈述,具体算法实现、实验设置与局限仍需查阅原文全文。