基于多AUV自组网的目标跟踪:一种价值梯度引导的多智能体扩散强化学习方法

arXiv cs.LG 论文

摘要

本文提出了VGG-MADiffRL——一种价值梯度引导的多智能体扩散强化学习算法,以及MDCA——一种分层控制架构,用于在受限声学通信和动态水下扰动下多AUV自组网中的协同目标跟踪。

arXiv:2608.12436v1 公告类型:新 摘要:基于多AUV自组网的目标跟踪要求联网的自主水下航行器(AUV)在受限声学通信、动态拓扑和不确定海洋扰动下协同跟踪机动目标。尽管多智能体强化学习(MARL)通过集中训练实现了分散协调,但现有方法面临高维联合状态-动作建模、对噪声敏感的策略生成等问题,导致训练不稳定和跟踪性能下降。为解决这些问题,我们提出了VGG-MADiffRL——一种价值梯度引导的多智能体扩散强化学习算法,以及MDCA——一种基于扩散的分层控制架构。利用水下任务特性,我们对声纳探测机制和洋流扰动进行建模,将多AUV自组网的协同跟踪问题表述为马尔可夫决策过程(MDP)。所提出的MDCA构成了一个三层闭环控制框架:全局智能控制层、局部在线训练层和物理动作执行层。该结构实现了任务分配、局部决策过程和执行反馈之间的协同优化。在MDCA中,局部在线训练层是策略学习框架;VGG-MADiffRL基于扩散策略,并引入价值梯度来引导反向去噪过程中的动作生成,使生成的动作趋向更高的期望回报。它采用双价值网络,结合联合优化和软目标更新,以缓解过估计和训练振荡,促进更稳定的收敛。实验结果表明,VGG-MADiffRL在协同跟踪场景中始终能实现更快的收敛、更高的跟踪精度和更平滑的训练动态,验证了其在动态水下环境中的有效性和实际工程价值。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:29

# 基于多AUV自组网的目标跟踪:一种值梯度引导的多智能体扩散强化学习方法
来源:https://arxiv.org/html/2608.12436
Chuan LinGuangjie HanShengchao ZhuQian ZhuYing LiuZhenyu Wang致谢:*通讯作者:Guangjie Han*致谢:Jiaao Ma、Chuan Lin、Qian Zhu、Ying Liu和Zhenyu Wang就职于中国沈阳东北大学软件学院。\(电子邮件:[email protected]; [email protected]; [email protected]; [email protected];[email protected]\)。致谢:Guangjie Han就职于中国常州河海大学海洋智能网络信息技术教育部重点实验室\(电子邮件:[email protected]\)。致谢:Shengchao Zhu就职于中国南京河海大学计算机科学与软件工程学院,邮编210013\(电子邮件:[email protected]\)。

###### 摘要

基于多AUV自组网的目标跟踪要求网络化的自主水下航行器\(AUV\)在受限声学通信、动态拓扑和不确定海洋扰动条件下协同跟踪机动目标。尽管多智能体强化学习\(MARL\)通过集中式训练实现了分布式协调,但现有方法在高维联合状态-动作建模、噪声敏感的策略生成方面存在不足,导致训练不稳定和跟踪性能下降。为解决这些问题,我们提出了VGG-MADiffRL,一种值梯度引导的多智能体扩散强化学习算法,以及MDCA,一种基于扩散的分层控制架构。利用水下任务特性,我们对声纳探测机制和海洋海流扰动进行建模,并将多AUV自组网的协同跟踪问题表述为MDP。所提出的MDCA构成一个三层闭环控制框架:全局智能控制层、本地在线训练层和物理动作执行层。该结构实现了任务分配、本地决策过程和执行反馈之间的协同优化。在MDCA中,本地在线训练层是策略学习框架;VGG-MADiffRL基于扩散策略,并引入值梯度以在反向去噪过程中引导动作生成,从而将生成的动作导向更高的期望回报。它采用双值网络联合优化和软目标更新来缓解过估计和训练振荡,促进更稳定的收敛。实验结果表明,VGG-MADiffRL在协同跟踪场景中始终实现更快的收敛、更高的跟踪精度和更平滑的训练动态,验证了其在动态水下环境中的有效性和实际工程价值。

###### 关键词:

自主水下航行器,多AUV自组网系统,水下目标跟踪,多智能体强化学习,扩散模型。

## I引言

海洋蕴藏着丰富的生物和矿产资源,是维持人类社会和推进深海战略计划的关键领域\[2 (https://arxiv.org/html/2608.12436#bib.bib1)\]。随着水下通信技术\[15 (https://arxiv.org/html/2608.12436#bib.bib2)\],特别是声学通信的发展,研究焦点已从单一AUV系统转向AUV集群系统\[16 (https://arxiv.org/html/2608.12436#bib.bib3)\]。在此类系统中,AUV形成自主组织、分布式、智能的多AUV自组网\(MAAN\)\[6 (https://arxiv.org/html/2608.12436#bib.bib4)\],即使在全球定位系统\(GPS\)受限或不可用的环境中,也能协同执行复杂的水下任务,如多目标跟踪和围捕\[8 (https://arxiv.org/html/2608.12436#bib.bib6),24 (https://arxiv.org/html/2608.12436#bib.bib5)\]。

然而,水下环境是动态且不确定的\[7 (https://arxiv.org/html/2608.12436#bib.bib7),14 (https://arxiv.org/html/2608.12436#bib.bib8)\]。传统以数据传输为中心的架构将网络视为被动管道,面对声学信道的挑战难以保持操作一致性:拓扑快速变化和带宽严重受限\[10 (https://arxiv.org/html/2608.12436#bib.bib9),3 (https://arxiv.org/html/2608.12436#bib.bib10)\]。克服这一瓶颈需要对AUV网络管理进行根本性转变:从被动接收数据转向主动感知和推理环境\[17 (https://arxiv.org/html/2608.12436#bib.bib11)\]。尽管集中式训练与分布式执行\(CTDE\)已被广泛用于解决多智能体环境中的非平稳性问题\[19 (https://arxiv.org/html/2608.12436#bib.bib16),9 (https://arxiv.org/html/2608.12436#bib.bib12)\],但其策略学习和优化在精确的连续协同跟踪方面仍存在困难,尤其是在自主网络节点关系频繁变化时。

在多AUV自组网协同跟踪任务中,基于MARL的现有方法仍面临三个主要挑战:\(1\) 对复杂连续动作分布的建模不足:传统确定性策略难以捕捉动态拓扑下协同决策所需的连续联合动作的强相互依赖性和耦合性,往往导致表达能力有限和次优决策\[13 (https://arxiv.org/html/2608.12436#bib.bib13)\]; \(2\) 由于依赖单一优化目标而导致的训练不稳定:当策略更新仅依赖于单一奖励信号或局部监督信号时,其对间歇性通信故障高度敏感,可能引起策略学习振荡、收敛缓慢和性能波动\[27 (https://arxiv.org/html/2608.12436#bib.bib14),26 (https://arxiv.org/html/2608.12436#bib.bib26)\]; \(3\) 采样过程中缺乏值引导:在扩散模型的反向去噪过程中,缺乏显式值约束会使采样动作偏离高期望回报区域,并引入无效噪声,降低决策一致性,这一问题在低带宽水下环境中尤为有害\[4 (https://arxiv.org/html/2608.12436#bib.bib15)\]\。

本研究解决了多AUV自组网协同跟踪中的训练不稳定、策略表示受限和动作采样次优问题。我们基于扩散过程的生成式建模范式,利用结合值估计损失与策略梯度的联合优化方案,提出了值梯度引导的多智能体扩散强化学习\(VGG-MADiffRL\)算法。通过用扩散策略替代确定性actor,并通过值梯度引导反向去噪轨迹,该框架使多AUV网络能够在拓扑变化下实现稳健的策略优化、更快的收敛和精确的协同动作。其核心组件如下。\(1\) 一种扩散策略架构,改进了对复杂且相互依存的协同动作的建模。\(2\) 一个结合值信号与策略梯度的双目标框架,以在拓扑变化时稳定训练。\(3\) 一种利用值梯度细化去噪轨迹的采样机制,优先选择具有高期望回报的动作。

1. 1.基于扩散模型的策略学习框架:VGG-MADiffRL用扩散模型替代传统确定性actor,构建与值估计紧密集成的生成式策略架构。这使多AUV自组网能够实现稳定且稳健的策略优化,从而增强策略对动态协同场景中固有的复杂、连续且高度相互关联动作分布的建模能力。
2. 2.actor网络组合优化机制:VGG-MADiffRL采用双目标优化方案,联合最小化由值估计指导的损失函数与策略梯度损失。由值信号引导的组件利用全局值估计约束扩散策略的更新方向,有效缓解了网络拓扑波动下单一目标优化导致的策略振荡。
3. 3.值梯度引导的扩散采样机制:VGG-MADiffRL将值信号集成到反向去噪过程中,迭代细化去噪轨迹,从一开始就将动作采样引向高期望回报区域。该机制减少了次优或无关动作的影响,增强了带宽受限且拓扑自主组织的水下网络中的训练稳定性。

本文的其余部分组织如下。第II节 (https://arxiv.org/html/2608.12436#S2)回顾相关工作。第III节 (https://arxiv.org/html/2608.12436#S3)展示了问题表述和系统预备知识。第IV节 (https://arxiv.org/html/2608.12436#S4)提出了MDCA框架。第V节 (https://arxiv.org/html/2608.12436#S5)详细介绍了基于VGG-MADiffRL的多AUV协同跟踪算法的实现。第VI节 (https://arxiv.org/html/2608.12436#S6)给出了实验评估和结果。最后,第VII节 (https://arxiv.org/html/2608.12436#S7)对全文进行总结并展望未来的研究方向。

## II相关工作

在本节中,我们主要回顾与该主题相关的近期研究工作,具体分为以下两个领域:1\) 基于强化学习/多智能体强化学习的AUV目标跟踪算法;2\) 基于扩散模型的强化学习方法。

### II-AAUV跟踪算法基于RL

在\[11 (https://arxiv.org/html/2608.12436#bib.bib17)\]中,提出了ACL-SAC,一种结合基于注意力的卷积LSTM与软演员-评论家\(SAC\)的AUV目标跟踪框架。它通过注意力加权的时间特征提取融合多传感器数据,并优化随机策略以平衡熵最大化和奖励累积。复合奖励函数和优先经验回放提高了训练效率,使其能够在海流扰动、声速不确定性和稀疏观测下实现稳健跟踪。

在\[20 (https://arxiv.org/html/2608.12436#bib.bib18)\]中,提出了DDPG-SAC用于欠驱动AUV在海流下的高精度路径跟踪。该方法解耦了纵荡和艏向控制,使用增强的视线\(LOS\)导引律补偿漂移,并应用低通滤波器抑制控制抖振。通过重新设计状态/动作空间和奖励函数,它处理了非线性动力学、时变水动力和环境扰动,在仿真中展现了良好的泛化能力和稳定性。

在\[5 (https://arxiv.org/html/2608.12436#bib.bib19)\]中,开发了AMAML用于未知时变动力学下的轨迹跟踪。它将问题分解为固定动力学子任务,使用LOS导引将跟踪建模为马尔可夫决策过程,并嵌入注意力模块以捕捉隐藏动态特征。将近端策略优化与最大熵元学习相结合,实现了跨任务的快速适应,克服了传统RL泛化能力差和模型依赖性强的问题。

在这些单智能体进展的基础上,研究已转向多智能体协调,其中扩散模型越来越多地与多智能体强化学习相结合,以解决动态水下环境中复杂的协同决策问题。

### II-B基于扩散模型的MARL

在\[30 (https://arxiv.org/html/2608.12436#bib.bib20)\]中,MADiff引入了一个基于扩散的离线多智能体强化学习框架,通过潜在空间注意力对智能体间协调进行建模,并将分布式执行与集中式训练和队友建模统一起来。它使用无分类器引导生成高回报轨迹,并通过逆动力学模型恢复动作,有效解决了离线环境中的外推误差和表达能力受限问题。

在\[18 (https://arxiv.org/html/2608.12436#bib.bib21)\]中,HGCD通过将异构图注意力机制集成到扩散过程中,将该思想扩展到异构团队,使其能够适应未知的团队组成。结合离线元强化学习,它在支持分布式部署的同时实现了跨团队的策略泛化,并解决了数据多样性、组合泛化和实际应用方面的挑战。

在\[25 (https://arxiv.org/html/2608.12436#bib.bib22)\]中,DMADRL将扩散模型应用于语义车辆边缘计算中的在线决策。它将去噪过程表述为MDP,以联合优化语义任务卸载和资源分配。利用复合奖励\(语义保真度、优先级、能量\)和Gumbel-Softmax重参数化,它处理了混合离散-连续动作空间和动态通信约束,提高了系统效用和延迟性能。

尽管取得了这些进展,现有基于扩散的MARL方法要么是离线的\(MADiff, HGCD\),要么针对车辆网络等离散-连续混合领域\(DMADRL\),无法直接适用于动态水下环境中在线、纯连续、固定编队的多AUV跟踪。为填补这一空白,本文提出了VGG-MADiffRL和MDCA架构,将值梯度引导的扩散采样、双目标策略优化和分层协调相结合,以增强复杂协同水下跟踪任务中的训练稳定性、动作质量和鲁棒性。

## III预备知识

为准确模拟多AUV自组网在动态水下环境中的避障和目标跟踪行为,我们将海流扰动和节点间通信约束纳入建模过程,从而捕捉真实的水下网络动态。基于该模型,多AUV系统的协同作业问题被表述为马尔可夫决策过程\(MDP\)。

### III-A海流建模

考虑到水下环境的不确定性和动态性,采用声纳实现AUV与目标之间的精确相对定位。AUV发射声波扫描周围环境,扇形覆盖接收阵列捕获来自多个方向的回波,通过强度分析实现目标定位。目标检测过程使用公式\(1 (https://arxiv.org/html/2608.12436#S3.E1)\)中的主动声纳方程建模:

EM=SL−2TL+TS−\(NL−DI\)−DT,\\mathrm\{EM\}=\\mathrm\{SL\}\-2\\mathrm\{TL\}\+\\mathrm\{TS\}\-\(\\mathrm\{NL\}\-\\mathrm\{DI\}\)\-\\mathrm\{DT\},\(1\)其中EM\\mathrm\{EM\}是过量余量,SL\\mathrm\{SL\}是声源级,TL\\mathrm\{TL\}是传播损失,TS\\mathrm\{TS\}是目标强度,NL\\mathrm\{NL\}是环境噪声级,DI\\mathrm\{DI\}是方向性指数,DT\\mathrm\{DT\}是检测阈值\(单位为分贝\)。

纳维-斯托克斯方程是描述流体运动的基本控制方程。它精确刻画了流体的动态行为,可用于分析和计算海洋环境中水下航行器所受的流体动力。方程的数学形式见公式\(2 (https://arxiv.org/html/2608.12436#S3.E2)\):

ρ⁡\(∂u∂t+u⋅∇u\)=−∇p+μ∇2u+F,\\rh

相似文章

学习合作、竞争和沟通

OpenAI Blog

OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。

部分可观测环境中的生成模型预测规划导航

arXiv cs.AI

本文介绍了BeliefDiffusion,一种结合扩散模型表示多模态信念分布和使用模型预测控制在部分可观测环境中进行规划的框架,相比基线方法取得了更好的导航成功率和路径效率。