可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学
摘要
本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。
arXiv:2605.30461v1 Announce Type: new
摘要:我们提出了一种分布式的约束多智能体强化学习方法,该方法结合了状态增强策略学习与对偶变量上的分布式一致性。我们的方法针对智能体具有可分离动力学但必须协调以满足全局资源约束的系统。在这个设置中,我们通过实验证明,独立学习无法产生可行解,因为智能体无法确定各自对集体约束满足的适当贡献。关键技术贡献在于表明,对拉格朗日乘数进行轻量级的邻居间一致性足以为全局协调的约束执行提供支持,同时保持独立训练的可扩展性。每个智能体离线学习一个单一的增强策略,该策略以其局部状态和编码约束反馈的对偶变量为条件。在执行过程中,智能体仅通过本地通信就能在该对偶变量上达成一致。我们证明,在温和的连接假设下,智能体乘数间的一致性误差是有界的,并且表明这转化为有界的约束违反,该违反随着图连通性和一致性轮数而减小。与集中式训练分散式执行(CTDE)方法不同,后者的复杂度至少随智能体数量二次增长,而我们的方法在训练和执行中都是线性扩展。智能电网需求响应上的实验表明,一致性协调是\emph{可行性的关键}:没有它,智能体只能通过无限期推迟需求来满足电网容量约束,这是一种退化的非解。通过一致性,智能体收敛到共享的对偶变量,同时满足电网约束和需求满足,扩展到数千个智能体,而CTDE基线仅限于数十个。
查看缓存全文
缓存时间: 2026/06/01 09:25
# 通过状态增强与一致性实现可扩展的约束多智能体强化学习(适用于可分离动力学) 来源:https://arxiv.org/html/2605.30461 Santiago Amaya-Corredor [email protected] 庞培法布拉大学工程学院 Miguel Calvo-Fullana [email protected] 庞培法布拉大学工程学院 Anders Jonsson [email protected] 庞培法布拉大学工程学院 ###### 摘要 我们提出了一种用于约束多智能体强化学习(CMARL)的分布式方法,该方法将状态增强策略学习与对偶变量的分布式一致性相结合。我们的方法针对的是智能体具有可分离动力学但必须协调以满足全局资源约束的系统。我们通过实验证明,在这种设定下,独立学习无法产生可行解,因为智能体无法确定为实现集体约束满足所需的适当个体贡献。关键的技术贡献在于证明:对拉格朗日乘子进行轻量级的邻居间一致性协商,足以实现全局协调的约束执行,同时保留独立训练的可扩展性。每个智能体离线学习一个增强策略,该策略以其局部状态和编码了约束反馈的对偶变量为条件。在执行过程中,智能体仅通过局部通信就能就此对偶变量达成一致。我们证明,在温和的连通性假设下,智能体乘子间的一致性误差是有界的,并表明这转化为有界的约束违反,该违反程度随图连通性和一致性轮数的增加而减小。与训练和执行的复杂度至少随智能体数量平方增长的中心化训练与去中心化执行(CTDE)方法不同,我们的方法在训练和执行中均呈线性扩展。在智能电网需求响应上的实验表明,*一致性协调对于可行性至关重要*:没有它,智能体只能通过无限期推迟需求来满足电网容量约束,这是一种退化的非解。有了一致性,智能体收敛到一个共享的对偶变量,同时满足电网约束和需求满足,可扩展到数千个智能体,而CTDE基线只能处理数十个。 ## 1 引言 近年来,强化学习(RL)在解决多样化的复杂决策任务方面取得了显著成功(Brown and Sandholm, 2019 [https://arxiv.org/html/2605.30461#bib.bib49]; Orr and Dutta, 2023 [https://arxiv.org/html/2605.30461#bib.bib53]; Silver et al., 2017 [https://arxiv.org/html/2605.30461#bib.bib24])。其中许多成功案例涉及多个智能体,可归类为多智能体强化学习(MARL)。通常,MARL解决的是一个序列问题,其中一组自主智能体在共享环境中做出决策并交互,以最大化奖励。然而,随着智能体数量的增加,MARL问题可能迅速变得棘手,因为可能的交互数量和状态空间会随智能体数量呈指数级增长。此外,由于所有智能体同时导航和学习,环境可能变得非平稳,使得许多单智能体RL的假设失效。在现实场景中,通常需要权衡相互冲突的目标以获得满意的解。当增加自主智能体的数量时,这个问题会加剧,因为它们的特定目标通常不一致。在多智能体系统(MAS)中寻找最优策略通常至少需要一定程度的协调和通信。 我们的工作针对的是智能体具有可分离动力学但必须协调以满足全局操作约束的分布式系统。尽管与具有耦合动力学的通用MARL相比,这一假设更具限制性,但它使得训练和执行都能线性扩展,从而使我们的方法适用于数百或数千个智能体。该设定仍然是真正的多智能体,因为智能体必须通过一致性来协调以满足全局约束。这种结构自然出现在基础设施管理(例如,建筑恒温器、电动汽车充电器)中,其中本地控制器做出独立决策,但必须尊重系统范围的限制(例如,电网容量)。当智能体共享相同的MDP时,我们只需要为所有智能体训练一个策略,这大大降低了复杂度。多智能体协调在执行过程中通过对偶变量的一致性来实现。 我们的约束多智能体强化学习(CMARL)框架要求每个智能体在遵守对次要奖励的全局平均约束的同时最大化主要奖励,该约束充当耦合机制。智能体仅与网络中的直接邻居通信,这反映了全局广播不可行的现实约束。通过局部通信,智能体共享对偶变量以动态达成一致。关键的是,我们通过实验证明,这种协调不仅有益,而且*是必要的*:没有一致性,独立训练的智能体无法区分可行的需求管理与通过无限期推迟需求来实现的平凡约束满足。对偶变量一致性机制正是将独立训练的策略转变为集体可行解的关键。 我们开发了一种新颖的CMARL算法,并在智能电网管理(Dileep, 2020 [https://arxiv.org/html/2605.30461#bib.bib54])上进行了验证,优化能量分布的同时满足操作约束。我们的实验展示了在不同复杂性和智能体异质性的网络配置下的可扩展性。本文的贡献有三方面: 1. 1. 一种适用于具有可分离动力学的约束MARL的分布式一致性机制。我们将对拉格朗日乘子的分布式一致性与状态增强的约束RL相结合。我们在温和的连通性假设下证明了有界的一致性误差,并通过Lipschitz敏感性论证表明这意味着有界的约束违反。这使得仅通过局部通信就能实现全局约束协调,无需中心化评论家或联合状态观测。 2. 2. 训练和执行中的线性可扩展性。通过利用问题可分离性进行策略学习,并利用轻量级一致性进行协调,我们的方法可扩展至1000个智能体,而由于中心化评论家的需求,CTDE方法只能处理数十个智能体。 3. 3. 一致性协调对于可行性必要的实验证据。在智能电网经济调度中,我们展示了相同的独立训练策略会产生根本不同的结果(可行与不可行),这完全取决于是否启用了一致性。我们进一步与中心化最优解进行对比验证,表明分布式一致性实现了等效的约束满足和成本(差距<0.2%)。 ## 2 相关工作 **约束强化学习。** 约束RL使用带有副约束的目标进行公式化,通常通过拉格朗日方法求解(Altman, 2021 [https://arxiv.org/html/2605.30461#bib.bib3]; Borkar, 2005 [https://arxiv.org/html/2605.30461#bib.bib25])。我们区分两种范式:*安全RL*确保每步约束满足(Achiam et al., 2017 [https://arxiv.org/html/2605.30461#bib.bib21]; Chow et al., 2019 [https://arxiv.org/html/2605.30461#bib.bib5]; Achiam and Amodei, 2019 [https://arxiv.org/html/2605.30461#bib.bib2]),而*平均约束RL*允许暂时的违反,只要长期平均值保持在界限内(Liang et al., 2018 [https://arxiv.org/html/2605.30461#bib.bib13]; Paternain et al., 2022 [https://arxiv.org/html/2605.30461#bib.bib48])。后者适用于允许短暂峰值的资源管理。当对偶变量与约束满足之间的关系复杂时,标准拉格朗日方法可能无法产生可行策略。状态增强(Calvo-Fullana et al., 2024 [https://arxiv.org/html/2605.30461#bib.bib19])通过将对偶变量纳入状态表示来解决此问题,使策略能够根据当前约束压力水平调整其行为。我们的工作将状态增强从单智能体扩展到多智能体场景,通过对共享对偶变量进行分布式一致性来实现;并行出现的多智能体状态增强工作(Agorio et al., 2024 [https://arxiv.org/html/2605.30461#bib.bib23])则处理分配问题。 **合作式MARL。** 集中训练与分散执行(CTDE)已成为合作式MARL的主导范式(Kraemer and Banerjee, 2016 [https://arxiv.org/html/2605.30461#bib.bib12]),包括值分解方法(Sunehag et al., 2018 [https://arxiv.org/html/2605.30461#bib.bib56]; Rashid et al., 2018 [https://arxiv.org/html/2605.30461#bib.bib18]; Wang et al., 2021 [https://arxiv.org/html/2605.30461#bib.bib51])和具有集中式评论家的策略梯度方法(Lowe et al., 2017 [https://arxiv.org/html/2605.30461#bib.bib14]; Yu et al., 2022 [https://arxiv.org/html/2605.30461#bib.bib60]),尽管两者在智能体数量上的扩展性都很差。最近的研究质疑CTDE在许多场景下是否比独立学习更有优势(de Witt et al., 2020 [https://arxiv.org/html/2605.30461#bib.bib30]),尽管独立方法无法在没有额外机制的情况下处理全局约束。有关全面覆盖,我们参考最近的调查(Cheruiyot et al., 2025 [https://arxiv.org/html/2605.30461#bib.bib39]; Low and Zhou, 2025 [https://arxiv.org/html/2605.30461#bib.bib42]; Hady et al., 2025 [https://arxiv.org/html/2605.30461#bib.bib35])以及Albrecht等人(2024 [https://arxiv.org/html/2605.30461#bib.bib22])的教科书。我们的方法有根本不同:不是在训练期间集中化,而是独立训练策略,仅通过在执行期间的对偶变量一致性来协调。 **网络化与可扩展的MARL。** 一些工作通过利用网络结构实现了可扩展性。Zhang等人(2018 [https://arxiv.org/html/2605.30461#bib.bib61])为网络化智能体开发了完全分散的MARL,建立了具有局部通信的策略梯度方法的收敛性。Qu等人(2020 [https://arxiv.org/html/2605.30461#bib.bib52])提出了针对具有平均奖励目标的网络化系统的可扩展多智能体RL,通过可分离动力学实现了线性扩展,但没有处理约束。Chu等人(2020 [https://arxiv.org/html/2605.30461#bib.bib28])开发了一个针对具有局部奖励的网络化系统控制的多智能体RL框架。在电力系统领域,Chen等人(2022 [https://arxiv.org/html/2605.30461#bib.bib26])开发了用于可扩展电网控制的PowerNet,Feng等人(2024 [https://arxiv.org/html/2605.30461#bib.bib32])解决了用于分散式电压控制的稳定性约束RL,Mai等人(2024 [https://arxiv.org/html/2605.30461#bib.bib44])研究了用于快速时间尺度需求响应的多智能体RL。最近,Wang等人(2025 [https://arxiv.org/html/2605.30461#bib.bib41])提出了用于多目标微电网调度的分布式MARL,使用具有多个评论家的actor-critic方法,通过邻居间通信实现协调;然而,他们的方法针对帕累托优化,没有明确的全局约束处理。虽然这些工作通过网络结构展示了可扩展性,但没有提供满足耦合智能体决策的全局约束的机制。 **约束多智能体强化学习。** 最近的工作解决了具有耦合动力学的MARL中的约束。Lu等人(2021 [https://arxiv.org/html/2605.30461#bib.bib43])提出了用于分布式约束MDP的Safe Dec-PG,实现了收敛,但计算复杂度限制了实验只能处理5个智能体。Gu等人(2021 [https://arxiv.org/html/2605.30461#bib.bib33])引入了多智能体约束策略优化(MACPO),将TRPO-Lagrangian扩展到多智能体设定。Ying等人(2023 [https://arxiv.org/html/2605.30461#bib.bib59])开发了一种使用κ跳截断的原始-对偶 actor-critic 方法,在约束耦合精度和可扩展性之间进行权衡。Zhang等人(2024 [https://arxiv.org/html/2605.30461#bib.bib62])引入了具有局部策略优化的Scal-MAPPO-L,尽管他们注意到状态-动作空间随邻域大小呈指数增长(实验限于12个智能体)。在理论方面,Chen等人(2024 [https://arxiv.org/html/2605.30461#bib.bib27])建立了硬性结果,表明约束合作式MARL在一般情况下是计算上难以处理的,而Ding等人(2023 [https://arxiv.org/html/2605.30461#bib.bib1])提供了一种具有可证明样本高效收敛性的广义拉格朗日原始-对偶方案。重要的是,这些方法针对的是*安全约束*,要求在*耦合动力学*下每步满足约束,其中智能体的状态转移直接影响彼此。虽然比我们的设定更通用,但这种通用性带来了计算成本,限制了可扩展性至数十个智能体。我们针对*平均约束满足*和*可分离动力学*——这些假设在许多基础设施管理问题中得到满足——从而实现了可证明的线性扩展,演示规模达1000个智能体。 **RL中的分布式优化与一致性。** 我们的对偶一致性机制建立在具有耦合约束的分布式优化(Nedic and Ozdaglar, 2009 [https://arxiv.org/html/2605.30461#bib.bib46]; Olfati-Saber et al., 2007 [https://arxiv.org/html/2605.30461#bib.bib17])之上,并最近扩展到RL设定(Yarmoshik et al., 2024 [https://arxiv.org/html/2605.30461#bib.bib58]; Wang et al., 2024 [https://arxiv.org/html/2605.30461#bib.bib57])。密切相关的,Oh等人(2025 [https://arxiv.org/html/2605.30461#bib.bib47])开发了用于网络优化的基于一致性的actor-critic,其中智能体与邻居共享*局部奖励*以近似全局回报,无需集中训练。我们的一致性操作在一个根本不同的量上:*对偶变量*(拉格朗日乘子)而非奖励。在奖励一致性方法中(Oh et al., 2025 [https://arxiv.org/html/2605.30461#bib.bib47]; Wang et al., 2025 [https://arxiv.org/html/2605.30461#bib.bib41]),每个智能体的可行性是独立的,而我们的全局约束 ∑ᵢ V₁ⁱ(πⁱ) ≤ c 耦合了智能体的可行集。这需要状态增强策略 πⁱ(s, λ) 响应变化的乘子——这是奖励一致性方法中所没有的设计。正如我们在第7.2节 [https://arxiv.org/html/2605.30461#S7.SS2] 中展示的,这种协调对于可行性是必要的。 **电力系统的神经控制器。** Cui等人(2023 [https://arxiv.org/html/2605.30461#bib.bib29])提出了使用严格凸神经网络的结构化神经PI控制器,通过平衡无关被动性实现稳定性和输出跟踪——这是一种需要了解系统动力学的基于模型的方法。Feng等人(2023 [https://arxiv.org/html/2605.30461#bib.bib31])构建了用于电压调节的分散式RL控制器,结合了瞬态神经策略和稳态梯度流优化器。虽然两者都涉及具有分布式控制器的电力系统,但他们的重点是*稳定性和跟踪*而不是*约束满足*,他们将约束嵌入到控制器架构中,而不是通过拉格朗日对偶性显式处理。这些方法是互补的。 **定位我们的工作。** 表1 [https://arxiv.org/html/2605.30461#S2.T1] 总结了我们的方法与先前方法在三个维度上的比较:约束类型、动力学结构和可扩展性。
相似文章
基于约束流形控制的安全且可泛化的分层多智能体强化学习
本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。
电动汽车大规模车队的智能充电:独立多智能体强化学习方法
本文比较了上下文组合赌博机和策略梯度算法在大型电动汽车车队分散式智能充电中的应用,使用了包含动态定价和可再生能源数据的真实模拟环境。
多智能体RL何时能提升LLM工作流?工作流、规模与策略共享的权衡
本文研究了端到端强化学习训练何时能改善多智能体LLM工作流,比较了不同工作流、任务和模型规模下的共享策略与隔离策略训练,揭示了条件性权衡。
学习合作、竞争和沟通
OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。
面向分布式能源资源协调的监督强化学习
本文提出了一种监督强化学习(SRL)框架,用于协调分布式能源资源,通过在演示数据上预训练并通过强化学习微调,以提高样本效率和性能。