SIGMA:结构噪声效应感知分组多智能体聚合
摘要
本文提出SIGMA,一个用于协作多智能体强化学习的层次化协作框架,通过基于密度的分组和聚合方法,利用协作结构在噪声观测下学习鲁棒表示。
arXiv:2608.26683v1 公告类型:新
摘要:协作多智能体强化学习 (MARL) 在噪声观测下维持鲁棒协调面临重大挑战。尽管观测扰动通常独立地在各智能体上引入,但其对协作决策的下游效应可以通过底层协作结构变得结构化。我们将此现象表征为结构噪声效应,即噪声诱导的决策效应在具有更强任务依赖性的智能体间表现出局部相关性,同时在不同智能体和局部结构间保持全局异构性。然而,现有的鲁棒MARL方法很少显式地表征或利用这种依赖于结构的噪声效应。为解决此限制,我们提出SIGMA,一个利用协作结构在噪声观测下学习鲁棒表示的层次化协作框架。SIGMA首先通过基于密度的分组将智能体组织成自适应的局部结构,并执行组内共识聚合以保留共享的任务相关信息,同时平滑智能体特定的表示偏差。然后,组间注意力自适应地整合不同组间的信息,以维持全局协调并容纳其异构贡献。在StarCraft II的噪声观测任务上的实验实证验证了结构噪声效应,并证明SIGMA在观测噪声下持续提高鲁棒性,同时在无噪声环境中保持竞争力。
查看缓存全文
缓存时间: 2026/08/28 09:36
# SIGMA:结构化噪声效应感知的分组多智能体聚合框架 来源:https://arxiv.org/html/2608.26683 ###### 摘要 协作多智能体强化学习(MARL)在噪声观测条件下维持稳健协调面临重大挑战。尽管观测扰动通常独立作用于各智能体,但其对协作决策的下游影响可通过底层协作结构形成**结构化噪声效应**——噪声诱导的决策影响在任务依赖较强的智能体间呈现局部相关性,而在不同智能体与局部结构间保持全局异质性。现有鲁棒MARL方法很少显式刻画或利用此类结构依赖的噪声效应。为此,我们提出SIGMA分层协作框架,通过协作结构学习噪声观测下的鲁棒表征。该框架首先基于密度聚类将智能体组织为自适应局部结构,通过组内共识聚合保留共享任务相关信息并平滑智能体特异性表征偏差;随后通过组间注意力机制自适应整合跨组信息,在容纳异质贡献的同时保持全局协调性。在《星际争霸II》噪声观测任务上的实验验证了结构化噪声效应的存在,并证明SIGMA在观测噪声下显著提升鲁棒性,同时在无噪声环境中保持竞争力。 同济大学计算机科学与技术学院 中国上海 [email protected] ## 引言 协作多智能体强化学习在解决需要多智能体协调的复杂任务方面已取得显著进展,成功应用于多智能体游戏(Samvelyan等人 2019)、多机器人协调(Sadhu和Konar 2018;Hu等人 2023)以及自动驾驶(Li等人 2023)等领域。然而,大多数现有MARL方法假设智能体在决策过程中能获得可靠观测,这一假设在现实部署中可能不成立,因为感知误差、通信限制和环境干扰不可避免(Muratore, Gienger和Peters 2019)。噪声观测会扭曲智能体的局部感知并影响决策,可能破坏协调性并降低整体团队性能(Li等人 2022;Liu等人 2022;Zhang等人 2020b;Yang等人 2023)。噪声局部观测会阻碍智能体获取可靠的环境信息,从而影响协作策略学习(Muratore, Gienger和Peters 2019)。除个体感知误差外,观测不确定性还可能干扰协作交互,因为不可靠的局部信息会影响智能体与队友的协调方式(Kilinc和Montana 2018)。更重要的是,其影响不一定局限于观测直接受扰的智能体;仅扰动单个智能体就可能显著降低整个协作团队的性能(Lin等人 2020)。此类团队级影响在智能体间也非均匀分布,相似的观测损害可能因受影响智能体的不同而产生不同的协作结果(Barta, Nagy和Gulyás 2025)。 我们将这些非独立影响刻画为**结构化噪声效应**,其呈现两个互补特性:局部相关性与全局异质性。在局部层面,任务依赖较强的智能体往往表现出更相关的噪声诱导决策影响,反映了扰动效应通过局部协作交互的耦合性;在全局层面,这些影响的大小和模式可能在不同智能体与局部协作结构间存在显著差异,导致团队内扰动响应的异质性。这两个特性共同表明,观测噪声的下游影响受智能体间协作依赖关系的塑造:尽管扰动独立引入,但其影响通过底层协作结构变得结构化。 由于协作结构影响信息交换与决策耦合方式,相关研究已聚焦于协作MARL中的智能体关系建模。早期MARL方法主要依赖集中训练分散执行范式。尽管QMIX等值分解方法和MADDPG等集中评论器方法取得显著成功,智能体间的依赖关系通常通过学习的价值函数或集中表征隐式捕获。为克服这一局限,后续研究开始通过学习协调结构显式建模智能体关系。角色发现和基于分组的方法识别智能体间的功能特化或局部协作单元。近期基于图的关系模型(如MAGNet)被广泛用于捕获智能体间的动态交互,图神经网络建模成对依赖关系,而注意力机制实现自适应交互加权。基于超图的方法将这些思想扩展至多智能体间的高阶交互。这些方法显著提升了MARL中复杂协作模式的建模能力。 尽管取得这些进展,现有研究主要关注学习有效的协调结构,很少探究协作结构如何塑造观测噪声的影响。其他研究则聚焦于噪声观测下的鲁棒性学习。近期研究探索了多种缓解观测噪声不利影响的策略:MADDPG-M通过引入通信机制增强鲁棒性,但依赖可能实际场景不可用的额外通信媒介;Lin等人(2020)研究了协作MARL算法在噪声观测下的脆弱性,但未提供显式鲁棒性学习机制;近期方法通过单智能体扰动防御、对抗攻击学习和观测离散化提升鲁棒性,但通常将噪声建模为与个体智能体相关的独立不确定性,忽略了智能体间协作关系对噪声效应传播与累积的影响。 为填补这一空白,我们提出SIGMA分层协作框架,该框架显式利用协作结构提升噪声观测下的鲁棒性。基于结构化噪声效应的局部相关特性,SIGMA首先通过密度聚类将智能体组织为自适应局部结构,为后续聚合提供有意义的结构单元。在每个组内,建模智能体间的高阶交互并通过组内共识聚合其表征,保留共享任务相关信息并平滑智能体特异性表征偏差。鉴于结构化噪声效应的全局异质性,SIGMA进一步采用组间注意力自适应建模不同组间的依赖关系并整合组级信息,从而保持跨组协调。通过这种局部到全局的协作过程,SIGMA在保持局部结构信息与全局任务协调的同时学习鲁棒的协作表征。 本文主要贡献总结如下: - **结构化噪声效应刻画**:揭示独立引入的观测扰动可通过底层协作结构对协作决策产生局部相关且全局异质的影响。 - **SIGMA框架提出**:通过自适应分组与局部到全局表征聚合,利用结构化噪声效应巩固自适应局部结构内的协作信息,并进一步建模跨组依赖关系,实现在保持全局协调的同时进行鲁棒表征学习。 - **实验验证**:在SMAC噪声观测任务中进行大量实验,实证验证结构化噪声效应并评估SIGMA的鲁棒性。结果表明该方法在观测噪声下持续提升鲁棒性,同时在无噪声环境中保持竞争力。 ## 方法论 ### 问题形式化 我们考虑具有噪声观测的协作多智能体强化学习问题,可形式化为分散式部分可观测马尔可夫决策过程。环境定义为: \\[ \mathcal{M}=\left\langle\mathcal{N},\mathcal{S},\mathcal{A},P,R,\Omega,\gamma\right\rangle, \\] 其中\\(\mathcal{N}=\{1,\ldots,N\}\\)表示智能体集合,\\(\mathcal{S}\\)为全局状态空间,\\(\mathcal{A}=\{A_1,\ldots,A_N\}\\)为联合动作空间,\\(P\\)表示状态转移函数,\\(R\\)为共享奖励函数,\\(\Omega=\{\Omega_1,\ldots,\Omega_N\}\\)表示观测空间,\\(\gamma\\)为折扣因子。 在时间步\\(t\\),智能体\\(i\\)接收来自底层环境状态的局部观测: \\[ o_i^t=O_i(s^t), \\] 其中\\(s^t\in\mathcal{S}\\)表示全局状态。但现实环境因感知误差、通信限制和环境干扰不可避免地引入观测不确定性。因此智能体\\(i\\)实际接收的观测为: \\[ \widetilde{o}_i^t=o_i^t+\epsilon_i^t, \\] 其中\\(\epsilon_i^t\\)表示观测扰动。遵循常见鲁棒MARL设定,假设观测噪声跨智能体独立采样,即\\(\epsilon_i^t\perp\epsilon_j^t, \quad i\neq j\\)。 目标是学习分散策略\\(\pi=\{\pi_1,\ldots,\pi_N\}\\),最大化期望累积团队奖励: \\[ J(\pi)=\mathbb{E}_{\pi}\left[\sum_{t=0}^{T}\gamma^t r^t\right], \\] 同时在噪声观测下保持稳健的协作行为。 尽管观测扰动独立引入各智能体,但观测层面的独立性不一定意味着协作决策影响的独立性。在完全协作MARL中,智能体共享团队目标,其个体决策共同贡献于累积团队奖励。同时,协作底层的交互依赖通常非均匀:智能体可能在任务角色、局部交互及对共享目标不同组件的贡献上存在差异。因此独立引入的观测扰动可能对智能体决策产生依赖协作结构的影响。这一区分促使我们研究观测扰动如何与智能体间的潜在协作结构交互。下文将这些协作依赖的扰动影响形式化为**结构化噪声效应**,为后续结构感知表征学习框架提供动机。 ### 结构化噪声效应分析 尽管观测扰动独立引入各智能体,其诱导的协作决策影响不一定独立。在完全协作MARL中,智能体共享团队目标,但个体决策共同贡献于团队回报。然而这种全局协作并不意味着所有智能体间存在均匀的交互依赖。根据任务角色、局部交互和行为协调的不同,智能体在任务执行过程中可能表现出不同程度的依赖性。因此独立引入的观测扰动可通过这些底层协作交互产生结构依赖的影响。 为刻画此类影响而不将分析限制于特定MARL架构,令\\(\Phi_i^t\\)表示智能体\\(i\\)在时间步\\(t\\)的决策相关输出。在相同底层环境轨迹下,清洁与噪声观测对应的输出定义为: \\[ \Phi_i^{\mathrm{clean},t}=\Phi_i(o_i^{0:t}), \qquad \Phi_i^{\mathrm{noisy},t}=\Phi_i(\widetilde{o}_i^{0:t}). \\] 其中\\(\Phi_i^t\\)可能对应基于值方法的局部动作-价值估计或基于策略方法的策略输出。智能体\\(i\\)的噪声诱导决策影响刻画为: \\[ E_i^t=\mathcal{D}\left(\Phi_i^{\mathrm{noisy},t}, \Phi_i^{\mathrm{clean},t}\right), \\] 其中\\(\mathcal{D}(\cdot,\cdot)\\)表示清洁与噪声决策输出间的一般差异度量。此形式化区分了...
相似文章
基于符号图建模的冲突鲁棒多智能体推理
本文提出SIGMA,一种基于符号图的多智能体推理框架,显式建模LLM智能体之间的信任、冲突和中性关系,以实现冲突鲁棒且全局一致的预测,在六个基准测试上优于最先进的基线方法。
SIGMA:对称性感知、智能、几何、多目标自适应控制的鲁棒可靠交通管理
SIGMA是一个用于交通信号控制的强化学习框架,它集成了大语言模型以实现动态目标自适应,在模拟中展示了交通吞吐量和应急响应的提升。
Σ-Mem:面向基于LLM的多智能体系统的在线可靠性记忆
本文介绍了Σ-Mem,一种用于基于LLM的多智能体系统的在线可靠性记忆,它跟踪同伴的历史能力表现及同伴之间的关系,通过谱界实现稳定自适应,并通过残差引导、路由和加权投票来改善协调性。
NeuroMAS:将多智能体系统视为具有联合强化学习的神经网络
NeuroMAS将多智能体语言系统视为可训练的类神经网络架构,以LLM代理作为节点,利用强化学习来学习通信和专业化。实验表明,其性能得到提升,并且从较小的系统逐步扩展比从头训练大型系统效果更好。
Agent-G^2:基于高斯指导的代理强化学习
Agent-G^2 引入了一个高斯指导框架,用于强化学习中的提示深度,提升了长期代理任务的性能,无需额外的探测回合,并在 ALFWorld 和 WebShop 基准测试中取得优异结果。