arXiv 论文速递:让机器人学会“察言观色”——面向人机协作搬运的主动辅助框架 PROACT
论文标题为《Learning from Humans for Proactive Assistance in Human-Robot Collaborative Transport》(从人类示范中学习:人机协作搬运中的主动辅助),作者是 Elvin Yang 与 Christoforos Mavrogiannis。该论文于 2026 年 9 月 21 日(周一)19:41:30 UTC 提交至 arXiv,编号 arXiv:2609.25351(本次为 v1 版本),DOI 为 https://doi.org/10.48550/arXiv.2609.25351(由 DataCite 发放,尚待注册)。论文归类于机器人学(cs.RO),并交叉列入人机交互(cs.HC)与机器学习(cs.LG)。全文 PDF 约 5,807 KB,另有实验版 HTML 与 TeX 源码可供获取。
研究背景与问题设定
论文聚焦“人机协作搬运”这一具有广泛现实意义的任务:用户与机器人共同搬动体积庞大或重量较大的物体,应用场景横跨物流仓储、制造业与家庭环境。作者指出,要成为有效的协作伙伴,机器人必须同时满足两项看似冲突的要求:一方面要主动分担负载、高效地完成物体的移动,从而降低用户的体力消耗;另一方面又要保持对用户身体施力的物理响应性,不能“一意孤行”。
然而,现有研究往往把这两种能力割裂开来处理,结果产生了两类各有缺陷的机器人:一类能够高效搬运物体,却会抵抗用户的输入、忽视人的意图;另一类能够顺从用户的施力,却依赖用户持续不断地给出引导,无法自主预判与配合。
核心洞见与方法:PROACT 框架
作者的核心洞见是:在存在障碍物约束的协作搬运场景中,必须把“对人类协作行为的预测”与“柔顺的机器人控制”整合到同一个框架之内。基于此,论文提出了 PROACT——一个面向人机协作搬运的框架,其关键做法是将“预期/预判”(anticipation)嵌入到柔顺全身控制(compliant whole-body control)之中,而预判能力来自一个从数据中学习得到的人类协作行为模型。
具体而言,研究者构建了一个大规模、真实世界的人类双人协作搬运演示数据集,并在此基础上训练了一个基于 Transformer 的架构。该模型将人类的协作行为提炼、蒸馏为对“物体未来运动”的预测,从而使机器人能够在用户尚未明确施力或给出指令之前,就推断出物体接下来的运动趋势,并据此主动调整自身的全身运动,既保持柔顺可被推动,又主动贡献搬运力量。
实验结果与关键数据
研究团队使用一台 9 自由度(9-DoF)移动操作机器人,在真实世界中完成了 108 次试验。结果显示,与两个基线方法相比,PROACT 在多项指标上取得显著提升:
• 平均交互做功(mean interaction work)相比“仅柔顺控制”(compliance-only)基线降低 59.2%,相比 MPC(模型预测控制)基线降低 20.4%; • 平均完成时间(mean completion time)相比“仅柔顺控制”基线缩短 12.9%,相比 MPC 基线缩短 6.9%。
这两组数据说明,PROACT 不仅大幅减少了用户在搬运过程中付出的体力与交互代价,也提升了任务完成的效率,且在真实物理环境中得到验证,而非仅停留于仿真。
资源与获取方式
论文的实验视频可通过 https://youtu.be/qAGvQfVPjbk 观看;读者也可在 arXiv 上查看 PDF 全文、实验性 HTML 版本以及 TeX 源码,并按页面所示许可协议使用。论文由 Christoforos Mavrogiannis 提交(arXiv 页面提供作者邮箱查看入口)。需要说明的是,本文所述内容均基于论文摘要与 arXiv 元数据整理,具体的模型结构细节、数据集规模、实验设置与统计显著性分析,仍需以论文全文为准。
意义与展望
PROACT 的价值在于把“预判人类意图”和“保持物理柔顺”这两个此前常被分开处理的能力统一起来,为人机协作搬运提供了一条可行的技术路径:机器人不再只是被动跟随或固执己见,而是通过学习人类协作演示,提前预测物体的运动,从而主动而不过度地参与协作。随着此类方法在物流、制造与家庭服务等场景的落地,未来的人机协作有望在降低人的负担与提升任务效率之间取得更好的平衡。