AI News HubLIVE
站内改写1 分钟阅读

基于宏动作的多智能体指令跟随:通过价值校正

多智能体强化学习在现实应用中需要遵循外部自然语言指令,但指令可能打断正在进行的宏动作并导致价值估计不一致。本文提出宏动作价值校正(MAVIC)方法,通过校正指令边界处的贝尔曼备份,实现一致的策略价值估计。实验表明,MAVIC在复杂合作环境中能有效平衡指令遵循与基础任务性能。

来源arXiv AI作者: Wo Wei Lin, Ethan Rathbun, Enrico Marchesini Xiang Zhi Tan

多智能体强化学习(MARL)在真实世界应用时常需要响应外部自然语言指令,这些指令可能打断正在执行的宏动作,并与长期目标产生冲突。传统的基于奖励塑形的方法难以处理这种动态,因为贝尔曼更新会将不同指令上下文的价值估计耦合在一起,导致价值估计不一致。针对这一问题,来自台湾大学的研究团队提出了MAVIC(Macro-Action Value Correction for Instruction Compliance)方法,通过直接修正指令边界处的贝尔曼备份来解耦价值估计。

MAVIC的核心创新在于,当新指令到达时,它校正当前指令的目标,并恢复在原始目标下的延续价值。与奖励塑形不同,MAVIC修改的是自举目标本身,而非仅仅调整奖励信号。这使得在一个统一策略下能处理随机的指令切换,并保持价值估计的一致性。研究者提供了严格的理论分析,并在演员-评论家框架中实现了该方法。

实验在复杂度递增的合作多智能体环境中进行,包括简单的导航任务和复杂的协作操作场景。结果表明,MAVIC在保持基础任务性能的同时,实现了高指令遵循率。例如,在需要多个机器人协作完成组装任务的场景中,MAVIC能有效处理临时插入的指令(如“停止”或“改变方向”),而基线方法则出现性能大幅下降。这一工作为在现实环境中部署能够灵活响应外部指令的多智能体系统提供了新的思路,特别是在无人机群、仓储机器人等需要人机协作的领域具有重要应用前景。