何时沟通:基于KL散度与信念分布的多智能体强化学习门控机制
摘要
本文提出了一种基于智能体间信念分布KL散度的多智能体强化学习通信门控机制,在捕食者-猎物和MPE等基准测试中展示了性能提升和可解释性。
arXiv:2608.14559v1 Announce Type: new
摘要:多智能体强化学习中的有效通信要求智能体不仅要决定\textit{沟通什么},还要决定\textit{何时沟通}。现有方法要么在每个时间步都通信,要么通过REINFORCE策略梯度\cite{singh2019}学习一个二元门控信号,这是一种高方差信号,会导致门控行为不稳定且不可解释。我提出了一种基于原则的替代方案:仅当智能体学习到的信念分布之间的KL散度超过固定阈值时,智能体才进行通信。每个智能体维护一个关于潜在世界状态的信念分布(通过对其LSTM隐藏状态进行softmax计算得出),并且仅当信念差异大到足以证明信息交换的合理性时才进行通信。我在来自IC3Net\cite{singh2019}的捕食者-猎物基准测试(两种环境规模,各5个随机种子)以及MPE simple\_spread\cite{lowe2017}上评估了该方法,并与IC3Net、CommNet和独立控制器进行了比较。在PP 10$\times$10环境中,IC3Net在所有阈值下均优于KL-belief方法。在更具挑战性的PP 20$\times$20环境中,对$\varepsilon \in \{0.1, 0.3, 0.5, 1.0\}$的阈值消融研究显示出倒U形曲线:$\varepsilon=0.5$时达到了平均73.84步和42%成功率,而IC3Net为75.31步和31%,差距为1.47步和11个百分点,且随机种子方差更小。在MPE环境中,即使门控未激活,信念头也能将平均奖励提高12个点并将方差降低26$\times$,这表明存在两个正交的贡献:当信念能够收敛时的有原则门控,以及在无论门控是否激活的情况下都能改善协调的潜在表征。
查看缓存全文
缓存时间: 2026/08/18 09:41
# 基于信念分布与KL散度的多智能体强化学习原则性通信门控
来源:https://arxiv.org/html/2608.14559
###### 摘要
多智能体强化学习中的有效通信不仅要求智能体决定**何时通信**,还需决定**通信什么内容**。现有方法要么在每个时间步都进行通信,要么通过REINFORCE策略梯度[2]学习一个二元门控——这种高方差信号会导致不稳定且难以解释的门控行为。我提出一种原则性替代方案:仅当智能体学习到的信念分布之间的KL散度超过固定阈值时才进行通信。每个智能体维护一个基于LSTM隐藏状态的softmax计算得到的潜在世界状态信念分布,仅在信念分歧足以证明信息交换的必要性时才进行通信。我在IC3Net的Predator-Prey基准测试[2]上评估该方法(两种环境尺寸,每种5个随机种子),并在MPE simple\_spread任务[6]上进行对比,与IC3Net、CommNet和独立控制器进行比较。在PP 10×10环境中,IC3Net在所有阈值设置下均优于KL信念方法。在更复杂的PP 20×20环境中,对ε∈{0.1,0.3,0.5,1.0}进行阈值消融实验呈现倒U型曲线:ε=0.5时,KL信念方法平均步数为73.84步、成功率42%,而IC3Net为75.31步、成功率31%,差距达1.47步和11个百分点,且种子间方差更小。在MPE任务中,即使门控未激活,信念头仍能提升平均奖励12分并降低方差26倍,这表明存在两个正交贡献:在信念可收敛时实现原则性门控,以及通过改进的潜在表征提升协调能力。
## 1 引言
在许多现实世界的多智能体问题中,智能体无法观察环境的完整状态。每个智能体只能看到世界有限的局部信息,必须与其他智能体协作完成共享任务。通信是解决此问题的自然方式——通过信息共享,智能体能比单独行动时构建更完整的环境认知。但通信存在成本:在大规模系统中,广播每个时间步的信息代价高昂且往往不必要。更重要的是,在混合或竞争环境中,在不当时刻共享信息可能损害性能。例如猎物智能体不应向捕食者广播其位置。这引出一个根本问题:智能体应何时通信?
早期多智能体通信研究如CommNet[1]采用简单方法:智能体通过连续通道共享隐藏状态始终通信。这在完全协作场景中效果良好,但存在两个重要局限:第一,假设所有智能体共享全局奖励,随着智能体数量增加会导致信用分配困难;第二,由于每个智能体始终与其他所有智能体通信,该模型无法应用于智能体利益冲突的竞争或混合场景。
IC3Net[2]通过引入经REINFORCE训练的二元学习门控解决了这些局限,使其能跨协作、竞争和混合场景应用。然而该门控是完全通过奖励信号训练的黑箱,缺乏对通信发生原因的明确解释。因此通信频率在训练过程中剧烈波动,这是REINFORCE高方差的直接结果,导致IC3Net的门控行为难以解释或信任。
我认为通信决策应基于更原则性的依据:智能体对世界状态的认知分歧程度。若两个智能体观察到相同信息并形成相似信念,则无需交换新信息。但若其信念显著分歧——例如某个智能体定位到猎物而其他智能体仍在搜寻——通信才真正有价值。这不仅是直觉:从POMDP理论视角看,信念状态是不确定性下决策的充分统计量[3]。因此将通信触发机制建立在信念分歧基础上是具有清晰理论动机的原则性选择。
本文对IC3Net门控机制提出简单改进。每个智能体通过一个小型线性层加softmax处理LSTM隐藏状态,计算潜在世界状态的信念分布,生成K维概率向量:
$b^{i}_{t}=\text{Softmax}(f_{\phi}(h^{i}_{t}))\in\mathbb{R}^{K}$ (1)
智能体$i$仅在上一时间步与智能体$j$的信念分布KL散度超过阈值$\varepsilon$时才进行通信:
$g^{ij}_{t}=\mathbf{1}\left[D_{\mathrm{KL}}(b^{i}_{t-1}\,\|\,b^{j}_{t-1})>\epsilon\right]$ (2)
使用上一时间步信念是为了避免循环依赖:要决定是否与智能体$j$通信,理论上需要其当前信念,但该信息尚未接收。使用$b_{t-1}$可清晰打破此依赖关系。这一简单改进将IC3Net的黑箱REINFORCE门控替换为与智能体间不确定性分歧直接相关的原则性、可解释触发器。
我在IC3Net论文[2]的Predator-Prey基准测试(两种环境尺寸,每种5个随机种子)和MPE simple\_spread协作基准测试上评估该方法,对比对象包括IC3Net、CommNet和独立控制器。实验揭示两个一致性发现:首先在PP 10×10中,IC3Net在所有阈值下均优于KL信念方法,表明该原则性触发器需要足够的部分可观测性才能生效;其次在PP 20×20中,对ε∈{0.1,0.3,0.5,1.0}的阈值消融实验呈现清晰倒U型曲线:ε=0.5时KL信念方法平均步数73.84、成功率42%,而IC3Net为75.31步、成功率31%,差距达1.47步和11个百分点,且种子间方差更小(±1.20 vs ±1.82)。在MPE任务中,即使门控未选择性激活,信念头仍能提升表征能力,在适当校准的阈值下使平均奖励比IC3Net提高12分。
## 2 背景与相关工作
### 2.1 部分可观测多智能体设置
在许多现实协作任务中,智能体无法观察环境完整状态。这被形式化建模为分布式部分可观测马尔可夫决策过程(Dec-POMDP),其中$n$个智能体共享隐藏状态$s_{t}\in\mathcal{S}$。每个时间步智能体$i$接收依赖真实状态但未完全揭示的局部观测$o^{i}_{t}$,根据分布式策略$\pi^{i}(a^{i}_{t}\mid h^{i}_{t})$选择动作$a^{i}_{t}$,其中$h^{i}_{t}$总结其局部观测历史。环境根据$T(s_{t+1}\mid s_{t},\mathbf{a}_{t})$转移至下一状态,智能体获得奖励信号$r_{t}=R(s_{t},\mathbf{a}_{t})$。
POMDP理论的关键洞见是:信念状态——基于智能体观测历史对隐藏状态的概率分布——是不确定性下最优决策的充分统计量[3]。在单智能体设置中,维护并基于此信念状态行动已被充分理解。但在多智能体设置中,由于智能体观察环境不同部分,其信念状态存在差异。这种信念差异正是通信的价值所在:智能体可通过共享所知信息来解决彼此的不确定性。
### 2.2 通信学习
CommNet[1]是最早在多智能体系统中学习通信的深度学习方法之一。在CommNet中,每个智能体$j$通过LSTM维护隐藏状态$h^{t}_{j}$。每个时间步智能体向所有其他智能体广播其隐藏状态,每个智能体接收队友隐藏状态的平均值作为通信向量:
$c^{t}_{j}=\frac{1}{J-1}\sum_{j'\neq j}h^{t}_{j'}$ (3)
该通信是连续可微的,因此CommNet可通过反向传播端到端训练。它在完全协作任务中表现良好,但存在两个重要局限:首先使用全局平均奖励,使得个体智能体难以理解自身对团队绩效的贡献;其次由于智能体始终与所有对象通信,CommNet无法应用于共享信息可能损害自身性能的竞争或混合场景。
IC3Net[2]解决了这两个问题:为每个智能体提供独立奖励,有助于信用分配,并使模型能应用于协作、竞争和混合场景。对本文更重要的是,IC3Net添加了经学习的二元通信门控。每个时间步智能体$j$使用经REINFORCE训练的小型门控网络$f^{g}$决定是否通信[5]:
$g^{t}_{j}=f^{g}(h^{t}_{j})\in\{0,1\}$ (4)
通信向量变为活跃智能体隐藏状态的门控平均值:
$c^{t}_{j}=\frac{1}{J-1}\sum_{j'\neq j}h^{t}_{j'}\cdot g^{t}_{j'}$ (5)
IC3Net在标准基准测试中表现强劲,且经验性地学会仅在有益时通信——例如在竞争场景中,捕食者到达猎物后会停止通信。然而门控机制是黑箱:完全通过奖励信号训练,缺乏不确定性或信念分歧的明确概念。如本文所示,这导致训练过程中不稳定且混乱的通信模式。
### 2.3 定向与结构化通信相关工作
多项研究尝试使多智能体通信更具结构性和选择性。TarMAC[8]使用注意力机制允许智能体向特定队友发送定向消息而非广播。这提高了通信效率,但通信内容决策仍基于学习到的注意力权重而非原则性的不确定性度量。
DIAL[4]采取不同方法,允许智能体通过可微松弛学习离散符号。这使得通信协议在传输内容方面更可解释,但未解决何时通信的问题。
MADDPG[6]和QMIX[7]关注集中训练分布式执行,但两者均未显式建模通信门控。这些方法假设智能体可通过训练策略隐式协调而无需显式消息传递。
最近Hill等人[11]提出通信预测的未来计划而非原始观测,使用学习的世界模型生成信息。他们发现随着环境复杂度增加,工程化归纳偏置优于纯学习的端到端通信,这直接支持了我们工作的动机。他们通过世界模型预测解决通信什么的问题,我们则通过信念分歧解决何时通信的问题。
据我所知,此前尚无研究用基于学习信念分布KL散度的触发器替代IC3Net经REINFORCE训练的门控。最接近的相关思想是单智能体POMDP中信念表示的使用,其中信念状态直接指导决策。我的工作通过将信念分歧作为何时通信的原则性信号,将这一思想桥接到多智能体通信设置。
## 3 方法
### 3.1 基础架构
我的方法直接建立在IC3Net[2]基础上,保持其核心架构不变,仅替换通信门控。为完整性在此描述完整架构。
每个智能体$j$通过LSTM[9]维护隐藏状态$h^{t}_{j}$和细胞状态$s^{t}_{j}$。每个时间步智能体接收局部观测$o^{t}_{j}$,通过线性编码器$e(\cdot)$编码并更新隐藏状态:
$h^{t+1}_{j},s^{t+1}_{j}=\text{LSTM}\left(e(o^{t}_{j})+c^{t}_{j},\ h^{t}_{j},\ s^{t}_{j}\right)$ (6)
其中$c^{t}_{j}$是从其他智能体接收的通信向量。动作策略和价值头均直接从隐藏状态$h^{t}_{j}$计算。所有智能体共享相同网络参数,使模型对智能体排序不变,并能扩展至不同数量智能体而无需重新训练。
通信向量$c^{t}_{j}$计算为其他智能体隐藏状态的门控平均值:
$c^{t}_{j}=\frac{1}{J-1}\cdot C\sum_{j'\neq j}h^{t}_{j'}\cdot g^{t}_{j'}$ (7)
其中$C$是学习到的线性变换,$J$是存活智能体数量,$g^{t}_{j'}\in\{0,1\}$是智能体$j'$的通信门控。在原始IC3Net中,该门控通过REINFORCE训练。在我的方法中,用原则性的KL散度触发器替代,描述如下。
每个智能体使用独立奖励而非共享全局奖励进行训练,这是IC3Net的重要设计选择,使模型能在全局奖励失效的混合和竞争场景中工作。
### 3.2 信念头
我的方法关键新增部分是信念头——一个位于每个智能体LSTM隐藏状态之上的小型网络,生成$K$个潜在世界状态类别的概率分布。我称之为智能体对环境当前状态的信念。
形式化地,智能体$i$在时间步$t$的信念为:
$b^{i}_{t}=\text{Softmax}(f_{\phi}(h^{i}_{t}))\in\mathbb{R}^{K},\quad\sum_{k}b^{i}_{t}(k)=1$ (8)
其中$f_{\phi}$是参数为$\phi$的单层线性层,softmax确保输出是有效概率分布。所有实验中我使用$K=8$个类别,发现这足以捕获智能体间有意义信念差异而不增加过多参数。
信念头与网络其余部分端到端训练。它通过主策略损失接收梯度——无需为信念头设计单独损失函数。这意味着信念相似文章
知识与梯度引导的参数化动作马尔可夫决策过程强化学习
本文提出了KGRL,一种神经符号算法,利用以Datalog表达的领域知识来剪枝动作并约束参数,在参数化动作马尔可夫决策过程中提高了样本效率和回合回报,优于现有最先进的基线方法。
学习保留内容:面向多智能体LLM系统高效协作的Gated-Memory Routing
本文提出了Gated-Memory Routing,一个用于多智能体LLM系统的框架,该框架使用学习到的门控机制来管理记忆,提高了在推理和代码生成基准测试中的准确性并降低了推理成本。
基于约束流形控制的安全且可泛化的分层多智能体强化学习
本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。
学习合作、竞争和沟通
OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。
CurveRL:面向LLM推理的基于分布感知的上下文权重调整原则性方法
本文介绍了CurveRL,一种基于原则的分布感知提示权重调整方法,用于带有可验证奖励的强化学习(RLVR),通过基于通过率的排名和密度而非绝对值来分配权重,从而改进LLM推理,持续优于GRPO及其他基线方法。