多AUV自组网目标跟踪:价值梯度引导的多智能体扩散强化学习方法
本文提出 VGG-MADiffRL 算法和 MDCA 分层控制架构,用于多自主水下航行器(AUV)自组网中的协同目标跟踪。该方法将价值梯度引入扩散策略的逆向去噪过程,并采用双价值网络与软目标更新,以缓解过估计和训练震荡。在受限水声通信和动态海洋环境下,该方法相比现有方法收敛更快、跟踪精度更高、训练过程更平稳,具有实际工程价值。
多自主水下航行器(AUV)自组网目标跟踪是海洋智能无人系统领域的重要研究方向。在真实任务中,多个 AUV 通过水声通信组成临时网络,协同探测和跟踪机动目标。然而,水声通信带宽受限、网络拓扑动态变化、海洋洋流扰动不确定等因素,给协同跟踪带来了巨大挑战。传统方法往往难以在通信约束和动态环境下保持稳定的跟踪性能。
近年来,多智能体强化学习(MARL)提供了一种有前景的解决思路。通过集中式训练与分布式执行,智能体可以在训练阶段利用全局信息学习协调策略,在执行阶段仅依赖局部信息做出决策。不过,论文指出现有 MARL 方法仍存在两个主要问题:一是联合状态-动作空间维度高,建模复杂;二是策略生成对噪声敏感,容易导致训练不稳定和跟踪性能下降。
针对上述问题,论文提出 VGG-MADiffRL(Value Gradient Guidance Multi-Agent Diffusion RL)算法和 MDCA(diffusion-based hierarchical control architecture)分层控制架构。作者结合水下任务的特点,显式地对声呐探测机制和海洋洋流扰动进行建模,并将多 AUV 自组网中的协同目标跟踪任务形式化为马尔可夫决策过程(MDP),为后续算法设计和工程应用奠定了基础。
MDCA 是一个三层闭环控制框架。顶层为全局智能控制层,负责任务分配和全局层面的协调;中间层为本地在线训练层,是策略学习的核心;底层为物理动作执行层,将决策输出转化为 AUV 的实际运动指令。这种分层结构使系统能够在任务分配、局部决策和动作执行反馈之间进行协同优化,形成完整的闭环控制链路。
VGG-MADiffRL 在策略学习层面做出了关键创新。它以扩散策略为基础,在逆向去噪过程中引入价值梯度作为引导信号,使生成的动作逐步向更高期望回报的方向修正。这种方式既保留了扩散模型处理复杂分布的强大能力,又能提升动作生成的决策质量。为了进一步解决训练中的不稳定问题,算法采用双价值网络进行联合优化,并使用软目标更新策略,有效减轻了 Q 值过估计和训练震荡,促进了更稳定的收敛。
实验部分在协同目标跟踪场景中验证了所提方法的性能。结果显示,VGG-MADiffRL 相比基线方法能够更快地收敛,获得更高的跟踪精度,同时训练过程更加平滑。论文认为,这说明该方法在动态水下环境中具有较好的有效性和实际工程应用价值。