异质多团队系统中的利他协作学习
本研究提出一种基于汉密尔顿规则的异质多团队协作资源分配框架,通过动态机器人分配实现团队间利他协作。该问题被证明是NP难的,为此开发了图神经网络策略进行近似优化,在消防场景的仿真和实验中验证了其接近最优的性能和可扩展性。
近日,一篇来自arXiv的论文(arXiv:2605.21723)提出了一种在异质多团队系统中通过动态机器人分配实现利他协作的新方法。该研究由Riwa Karam等人完成,于2026年5月20日提交。研究将机器人视为可转移资源,借鉴生态学中的汉密尔顿规则(Hamilton's rule)作为利他决策机制。汉密尔顿规则原本用于解释生物间的利他行为,即当利他行为的收益与接受者的遗传相关度乘积大于成本时,利他行为会进化。研究者将其应用于多机器人系统,构建了一个考虑异质能力、转移成本和能力依赖贡献的协作资源分配框架。
该框架下的资源分配问题是一个组合优化问题,已被证明是NP难的。为了解决可扩展性问题,团队开发了一种基于图神经网络(GNN)的策略,采用集中训练与分散执行(CTDE)范式。在集中训练阶段,模型学习如何根据团队交互图做出决策;在分散执行阶段,每个机器人或局部决策者根据该策略进行实时分配。具体来说,模型在团队交互图上运行,预测机器人层面的转移决策(是否将某个机器人从当前团队转移到另一个团队)以及下一轮机器人到团队的分配,从而近似基于汉密尔顿规则的利他分配。
为了验证方法的有效性,研究团队在消防场景中进行了仿真和实验。在仿真中,他们模拟了多个消防团队应对不同火势的情况,机器人需要被分配到最需要的团队。实验结果表明,学习到的策略在性能上接近最优解,并且能够有效扩展到包含更多机器人和团队的更大系统。与基线方法相比,该策略显著提高了整体灭火效率,同时减少了资源浪费。
这项研究为多机器人系统的协作提供了新的思路,尤其是当机器人属于不同团队或组织时,如何通过利他行为实现整体最优。未来,该框架可应用于灾害响应、物流调度、搜索救援等领域,其中动态资源分配对任务成功至关重要。