多智能体协作何时有效?熵的视角
摘要
本文从熵的视角审视多智能体系统(MAS),分析智能体内部与之间的动态。研究发现,单个智能体通常优于MAS,并引入了熵判断算法以提高MAS性能。
arXiv:2602.04234v6 公告类型:交叉 \n摘要:多智能体系统(MAS)已成为利用大型语言模型(LLM)解决复杂任务的重要范式。然而,基于公开可用LLM构建的MAS的有效性机制,特别是其成功或失败的深层原因,仍然未经充分探索。本文通过\textit{熵}的视角重新审视MAS,考虑智能体内部与之间的动态,研究在不同拓扑结构、六个推理基准测试和两个智能体任务中问题解决过程中的熵变化。通过分析涵盖令牌级、智能体级和轮次级熵的245个特征,我们反直觉地发现,单个智能体在大约43.3\%的情况下优于MAS,并且熵动态在很大程度上由交互的第一轮决定。此外,我们提出了三个关键观察:1)\textit{确定性偏好}:峰值熵直接损害MAS的正确性,而稳定熵直接有益;2)\textit{基础熵}:基础模型在问题解决过程中较低的熵是MAS性能的因果驱动因素;3)\textit{任务感知}:MAS的熵动态在不同任务中扮演不同角色。基于这些发现,我们引入了一种简单而有效的算法\textit{熵判断器},用于从MAS的pass@$k$结果中选择解决方案,从而在所有MAS配置和任务中实现一致的准确性提升。我们的源代码可在\href{https://github.com/AgenticFinLab/multiagent-entropy}{此https URL}获取。
查看缓存全文
缓存时间: 2026/06/08 09:15
# 多智能体协作何时有效?一个熵的视角
**来源:** [https://arxiv.org/html/2602.04234](https://arxiv.org/html/2602.04234)
**Yuxuan Zhao**<sup>1,2</sup> **Sijia Chen**<sup>2</sup> **Ningxin Su**<sup>2</sup>
1. 哈尔滨工程大学烟台研究院
2. 香港科技大学(广州)
**项目页面:** [https://multiagent-entropy.github.io/](https://multiagent-entropy.github.io/)
###### 摘要
多智能体系统(MAS)已成为利用大语言模型(LLM)处理复杂任务的一种重要范式。然而,决定基于公开可用 LLM 构建的 MAS 有效性的机制,特别是其成功或失败的根本原因,在很大程度上仍未被探索。在本文中,我们从熵的角度重新审视 MAS,通过研究不同拓扑结构、六个推理基准以及两个智能体任务中问题解决过程中的熵转变,同时考虑智能体内部和智能体间的动态。通过分析涵盖 token 级、智能体级和轮次级的 245 个熵特征,我们反直觉地发现,在约 43.3% 的情况下,单智能体系统优于 MAS,并且熵动态主要在第一轮交互中决定。此外,我们提出了三个关键观察:1)**确定性偏好**:峰值熵直接损害 MAS 正确性,而稳定熵直接有益于 MAS 正确性;2)**基础熵**:在问题解决过程中具有较低熵的基础模型因果地驱动 MAS 性能;3)**任务感知**:MAS 的熵动态在不同任务中扮演不同角色。基于这些见解,我们引入了一种简单而有效的算法——**熵评判器**,用于从 MAS 的 pass@k 结果中选择解决方案,从而在所有 MAS 配置和任务中持续提高准确率。我们的源代码可在 [此 https URL](https://github.com/AgenticFinLab/multiagent-entropy) 获取。
## 1 引言
多智能体系统(MAS),其中每个智能体都基于大语言模型(LLM),被广泛应用于各个领域 [Du et al., 2023](https://arxiv.org/html/2602.04234#bib.bib33);[Hong et al., 2024](https://arxiv.org/html/2602.04234#bib.bib36);[Liu et al., 2024](https://arxiv.org/html/2602.04234#bib.bib58);[Paglieri et al., 2025](https://arxiv.org/html/2602.04234#bib.bib60);[Dang et al., 2025](https://arxiv.org/html/2602.04234#bib.bib32),甚至被认为是解决问题的唯一选择 [Zhang et al., 2024a](https://arxiv.org/html/2602.04234#bib.bib37)。然而,对于 MAS(特别是基于开源 LLM 构建的 MAS)是否能超越其对应的单智能体系统,以及是什么决定了其有效性,很大程度上仍未得到探索。现有工作观察到,单智能体系统(SAS)在某些任务上可以媲美甚至超越 MAS [Gao et al., 2025](https://arxiv.org/html/2602.04234#bib.bib34);[Tran and Kiela, 2026](https://arxiv.org/html/2602.04234#bib.bib25),而 MAS 的失败通常源于通信中断、智能体间对齐不足以及验证不充分 [Cemri et al., 2025](https://arxiv.org/html/2602.04234#bib.bib30)。特别是,最近的工作通过定量分析建立了 MAS 的规模原则 [Kim et al., 2025](https://arxiv.org/html/2602.04234#bib.bib27)。然而,这些研究主要基于准确率、延迟和成本等简单指标,而没有对底层机制提供更深入的理解。
熵已成为理解 LLM 推理的关键视角,范围从强化学习(RL)分析 [Cui et al., 2025](https://arxiv.org/html/2602.04234#bib.bib12) 到平衡探索与利用的训练算法 [Zhang et al., 2025a](https://arxiv.org/html/2602.04234#bib.bib20);[Zhu et al., 2025b](https://arxiv.org/html/2602.04234#bib.bib19)。值得注意的是,即使是对熵与准确率之间相关性的个别观察,也激发了对正则化、优势塑造和 token 更新的进一步研究 [Chen et al., 2025a](https://arxiv.org/html/2602.04234#bib.bib6);[Cheng et al., 2025](https://arxiv.org/html/2602.04234#bib.bib9);[Wang et al., 2025](https://arxiv.org/html/2602.04234#bib.bib8)。因此,对于基于 LLM 的 MAS——其本质复杂且表现出 token 级、智能体级和其他层面的不确定性——建立熵与推理可靠性之间的全面关系至关重要。虽然最近的工作从信息论角度进行了探索 [He et al., 2025](https://arxiv.org/html/2602.04234#bib.bib26);[Tran and Kiela, 2026](https://arxiv.org/html/2602.04234#bib.bib25),但它们局限于特定架构或 token 预算比较。
在本文中,我们通过研究不同 MAS 拓扑结构和任务下推理过程中涉及的不同级别、步骤和阶段的熵的整个生命周期来重新审视 MAS。具体来说,通过挖掘来自智能体内部和智能体间交互的大规模信息熵与 MAS 性能之间的细粒度关系,我们证明了 MAS 的有效性很大程度上由早期轮次的熵动态决定,其中峰值熵普遍有害。我们进一步通过因果推断验证,这些熵-性能关联反映了真实的因果机制,而不仅仅是相关性。总之,我们的主要贡献是:
- • 对四种 MAS 拓扑结构下的六个推理任务和两个智能体任务中的熵动态进行了系统研究,分析了 token、智能体和交互轮次级别的 245 个特征;
- • 反直觉的发现:在约 43.3% 的情况下 SAS 优于 MAS,强调了系统复杂度与性能之间的权衡;
- • 关于熵行为的三个见解:确定性偏好(峰值熵直接损害 MAS 正确性,而稳定的低熵直接有益于 MAS 正确性)、基础熵(较低的基础模型熵因果地驱动 MAS 性能)以及任务感知(熵模式在不同任务中有所不同);这些发现可推广到智能体设置,其中工具调用熵和第一轮智能体间分散性共同约束 MAS 正确性;
- • 熵评判器,从 MAS 的 pass@k 结果中选择高质量输出,并在所有配置和任务中持续提高准确率。
## 2 相关工作
基于大语言模型的多智能体系统(MAS)将复杂任务分解为专门的智能体,这些智能体通过多样化的协调拓扑结构进行交互 [Chen et al., 2024](https://arxiv.org/html/2602.04234#bib.bib31);[Zhang et al., 2024b](https://arxiv.org/html/2602.04234#bib.bib28);[Dang et al., 2025](https://arxiv.org/html/2602.04234#bib.bib32);[Zhang et al., 2025d](https://arxiv.org/html/2602.04234#bib.bib54),从而增强问题解决能力。除了提高 MAS 的准确率和效率,一些研究检查了 MAS 有效的条件。规模分析表明,增加智能体或改变协调结构的收益通常被通信开销和智能体间对齐不足所抵消,产生递减甚至负回报 [Kim et al., 2025](https://arxiv.org/html/2602.04234#bib.bib27)。最近的工作识别了 MAS 的关键失败模式,例如验证不足和通信中断 [Cemri et al., 2025](https://arxiv.org/html/2602.04234#bib.bib30)。最近,配备丰富技能库的 SAS 已被证明在准确率和效率上均可媲美甚至超越 MAS [Li, 2026](https://arxiv.org/html/2602.04234#bib.bib29)。虽然这些工作为 MAS 实践提供了信息,但它们依赖于无法捕捉系统复杂性的简单指标,因此无法揭示支配 MAS 有效性的根本原因。
最近的信息论分析 [He et al., 2025](https://arxiv.org/html/2602.04234#bib.bib26);[Tran and Kiela, 2026](https://arxiv.org/html/2602.04234#bib.bib25) 提供了更深入的见解,但局限于特定架构或 token 预算比较。然而,**分析 LLM 推理中的熵** 加深了我们对底层推理过程的理解 [Cui et al., 2025](https://arxiv.org/html/2602.04234#bib.bib12);[Zhu et al., 2025b](https://arxiv.org/html/2602.04234#bib.bib19)。在 RL 训练中,降低熵可以锐化输出分布并提高准确率 [Agarwal et al., 2025](https://arxiv.org/html/2602.04234#bib.bib11);[Karan and Du, 2026](https://arxiv.org/html/2602.04234#bib.bib3),但这种好处高度依赖于基础模型的能力,过度的熵降低可能触发**熵崩溃**,即模型变得过度自信并收敛到次优策略 [Yue et al., 2025](https://arxiv.org/html/2602.04234#bib.bib21);[Zhang et al., 2025c](https://arxiv.org/html/2602.04234#bib.bib7)。为缓解这一问题,最近的工作提出了熵干预方法,包括熵正则化 [Zhang et al., 2025b](https://arxiv.org/html/2602.04234#bib.bib16);[Chen et al., 2025a](https://arxiv.org/html/2602.04234#bib.bib6)、基于熵的优势塑造 [Cheng et al., 2025](https://arxiv.org/html/2602.04234#bib.bib9) 和熵引导的 token 更新 [Wang et al., 2025](https://arxiv.org/html/2602.04234#bib.bib8)。在测试时,熵也作为不确定性信号来动态调整推理深度和方向 [Li et al., 2026](https://arxiv.org/html/2602.04234#bib.bib14);[Yang et al., 2026](https://arxiv.org/html/2602.04234#bib.bib2)。虽然这些研究通过探测熵增强了单智能体推理,但它们很大程度上忽略了熵如何在多个交互智能体之间传播。为填补这一空白,我们分析基于 LLM 的 MAS 中的熵动态,以解释它们何时以及为何成功。
## 3 预备知识
设 \( M_{\text{base}} \) 是一个参数为 \( \theta \) 的 LLM,定义了在给定状态 \( s \) 下 token \( v \in \mathcal{V} \) 上的分布 \( \pi_\theta(v \mid s) \)。我们将多智能体系统(MAS)形式化为 \( \mathsf{M} = (A, G, R) \),其中 \( A \) 是一组智能体,每个智能体从 \( M_{\text{base}} \) 实例化而来,\( G = (A, E) \) 是一个有向交互图,\( R \) 是交互轮次数。在每一轮 \( r \) 中,智能体 \( a \) 生成一个推理轨迹 \( \tau_a^{(r)} \sim \pi_\theta(\cdot \mid \mathcal{H}_a^{(r)}) \),其中上下文 \( \mathcal{H}_a^{(r)} \) 由 \( G \) 决定如下,并且系统输出最终预测 \( \hat{y} \)。
**单智能体系统(SAS)**。\( A = \{a\} \), \( G = (\{a\}, \emptyset) \), \( \mathcal{H}_a^{(r)} = \{\tau_a^{(r')}\}_{r' < r} \)。
**多智能体系统(MAS)**。不同的拓扑结构对应于不同的 \( G \):
- **顺序结构**:链 \( a_1 \to a_2 \to \cdots \to a_{|A|} \),其中 \( \mathcal{H}_a^{(r)} \) 包含所有前驱智能体在之前轮次的轨迹。
- **并行结构**:所有智能体同时推理并共享它们的完整轨迹。
- **图结构**:可以表示一般的有向交互。
对于每个 MAS 配置,我们定义熵指标来量化推理过程中的不确定性。
## 4 实验设置
我们使用六个推理基准(例如数学推理、常识推理)和两个智能体任务(例如工具使用、多模态处理)来评估 MAS。我们考虑四种 MAS 拓扑结构:顺序、并行、全连接和广播。我们分析 245 个熵特征,涵盖 token 级(例如答案 token 的熵变化方向)、智能体级(例如智能体间回答的分散度)和轮次级(例如熵的跨轮次变化)。
## 5 关键见解
### 5.1 确定性偏好
我们发现峰值熵(即推理过程中熵的最大值)直接损害 MAS 正确性,而稳定的低熵直接有益于 MAS 正确性。这表明 MAS 中的不确定性峰值是性能下降的关键信号。
### 5.2 基础熵
基础模型 \( M_{\text{base}} \) 的熵动态因果地驱动 MAS 性能。具体来说,具有较低基础熵的模型在 MAS 配置中表现更好,这通过因果推断得到验证。
### 5.3 任务感知
熵模式在不同任务中有所不同。在需要多步推理的任务中,早期的熵峰值可能指示路径分歧,而在简单任务中,熵保持稳定。这种任务依赖性要求在不同上下文中采用不同的 MAS 设计。
## 6 熵评判器
基于上述见解,我们提出了熵评判器,一种简单而有效的算法,用于从 MAS 的 pass@k 结果中选择解决方案。该算法根据第一轮熵动态对输出进行排序,并选择具有最稳定(低且非峰值)熵的解决方案。我们在所有配置和任务上持续观察到了准确率的提升。
## 7 结论
本文从熵的角度重新审视了多智能体系统,揭示了熵动态与 MAS 有效性之间的因果联系。我们的工作表明,MAS 的成功在很大程度上由早期轮次的熵模式决定,其中峰值熵普遍有害。我们提出了三个关键见解(确定性偏好、基础熵和任务感知),并开发了熵评判器来利用这些见解。我们的工作为设计更可预测和更有效的 MAS 提供了信息论基础。
**附录 D(见原文章)** 提供了关于因果推断的更多细节,包括 PC 和 FCI 图发现以及 DoWhy ATE 估计。
#### C.4.1 成对相关性分析
为了表征特征冗余,我们分析了 \( \mathcal{G}_{\text{MAS}} \) 的成对 Pearson 相关矩阵。与预期一致,高度相关的特征形成不同的块(例如,`sample_mean_*` 与 `sample_median_*`;`std_*` 与 `variance_*`)。我们没有将这些视为冗余而丢弃,而是利用这种结构来观察 SHAP 在每个块中优先选择哪个特定统计量,从而提供比选择单个代表性特征更细粒度的可解释性。更值得注意的是,基础模型熵特征与 MAS 熵动态表现出强关联。例如,`base_model_min_answer_token_entropy` 与 `answer_token_entropy_change_direction` 相关,`base_model_is_finally_correct` 与 `is_finally_correct` 相关。这些跨层关联直接强化了我们在第 4.4 节中的发现,即 \( M_{\text{base}} \) 的熵和正确性调节了 MAS 的有效性。此外,`architecture` 与许多熵特征表现出强相关性(\( |\rho| > 0.5 \)),证实了不同的 MAS 拓扑结构诱导不同的熵动态,与第 5.2 节一致。相关图还告知了随后在我们的因果流程中应用的 \( |\rho| > 0.85 \) 剪枝阈值(附录 D)。
#### C.4.2 PCA 分析
我们对在 44,780 个样本上计算的标准化 245 维特征空间应用主成分分析。如图 7(a) 所示,特征值谱揭示了一个分布式的方差结构。第一主成分解释了总方差的 21.1%,前三个主成分解释了 41.3%,前五个主成分解释了 54.0%,需要 43 个主成分才能达到 95% 的累积解释方差,即 82.4% 的降维。我们得出两个操作含义,两者都不与定义性冗余的存在相矛盾。首先,不存在小的主导子空间(前三个主成分仅解释约 41% 的方差)表明,潜在的熵信号分布在许多正交方向上。即使在单个特征重叠的情况下,整个特征集捕捉了 MAS 熵的多个方面,而不是单一主导轴。其次,尽管 43 个主成分足以解释 95% 的方差,但用这个 PCA 表示替换原始特征会带来不小的分类代价。XGBoost F1 从 89.16% 下降到 86.13%(\( \Delta \)F1 = -3.03%),LightGBM 从 89.10% 下降到 86.03%(\( \Delta \)F1 = -3.07%),随机森林从 88.13% 下降到 86.06%(\( \Delta \)F1 = -2.07%)。因此,原始特征携带了线性投影所抹去的互补非线性信息。这就是为什么我们在熵评判器中保留完整特征集,而将目标冗余移除保留给因果分析,在那里共线性确实有害。
**图 7:** PCA 分析和特征消融研究。(a) 245 维熵特征空间的 PCA 方差解释。曲线显示了累积解释方差随主成分数量的变化。达到 95% 的解释方差需要 43 个主成分,表明信息分布在许多维度上,而不是集中在少数主导方向上。(b) 递归特征消除(RFE)性能曲线。最优子集包含 25 个特征,达到了最高准确率(86.77%)和 F1(88.92%)。随着添加更多特征,性能趋于平稳并略微下降,表明模型没有过拟合到高维空间。
#### C.4.3 特征消融研究
为了评估冗余特征集携带了多少独特的预测内容,我们使用随机森林作为基础估计器,通过 5 折交叉验证进行递归特征消除(RFE)。图 7(b) 显示了随着特征逐步移除的性能轨迹。结果揭示了一个特征性的平稳模式。一个紧凑的 25 个特征子集达到了接近最优的性能(准确率 86.77%,F1 88.92%),而添加剩余的 220 个特征仅略微改变性能(全集准确率 85.85%,F1 88.13%)。性能不会随着特征增多而持续增加;在最优 25 个特征之外略有下降,这与一个吸收相关输入而不发生过拟合的正则化模型一致。这种平稳与我们为特征集显式设计的冗余一致。一小部分核心特征携带了大部分预测信号,而其余特征以不损害预测性能为代价提供了跨统计量和层次级别的解释性覆盖。同样的观察直接促使了目标特征相似文章
多智能体系统与单智能体系统
本文指出,大多数所谓的“智能体化”系统实际上只是配备工具的单智能体,并强调了多智能体架构带来的高昂成本和复杂性。文章梳理了三种有效的多智能体模式——编排者-工作者、流水线以及点对点模式,并提供了判断何时采用多智能体而非单智能体的标准。
递归多智能体系统
本文提出RecursiveMAS,一种将递归扩展原则应用于多智能体系统的框架,以提升协作推理的效率和准确性。与标准基线相比,该框架在多个基准测试中实现了显著的加速和token缩减。
多智能体优势的幻觉
本文挑战了多智能体系统优于单智能体系统的普遍说法,通过系统评估证明了自动生成的多智能体架构在性能上不如使用自一致性的思维链(CoT-SC),同时成本却高出高达10倍,并揭示了当前自动设计范式中的架构臃肿问题。
多智能体系统是否已准备好投入生产?
一位开发者分享了对多智能体系统的挫败感,指出它们比单智能体系统复杂得多,且结果往往更差,并寻求关于协调和减少复杂性的工具建议。
我认为多智能体协作目前基本上是一个错误前提
作者认为,人工智能中的多智能体协作目前是一个错误前提,因为在这种系统中,语言模型的缺陷被放大,导致它们在生产环境中不可靠。