重新思考多智能体协作:多即是少

arXiv cs.AI 论文

摘要

本文阐述了基于大语言模型系统中多智能体协作的能力边界,表明仅在特定任务结构中有益,例如具有稀疏依赖关系的长期任务,并提出了SAIGE,一种基于动态图的高效协作机制。

arXiv:2609.19759v1 Announce Type: new 摘要:大语言模型和单智能体系统的快速发展重塑了自主系统的格局,引发了一个关键问题:多智能体协作何时才能提供真正价值。随着单个智能体能力的持续扩展,多智能体协作面临收益递减,同时产生日益增长的上下文开销。通过系统分析,我们阐述了多智能体协作相对于单智能体替代方案的能力边界,表明它在具有稀疏依赖关系的长期任务中提供系统性益处,而单智能体系统在紧密耦合的顺序工作流中仍然更优。基于这些见解,我们提出了SAIGE,一种基于语义感知增量图演化的轻量级多智能体协作机制。SAIGE将协作建模为一个动态演化的图,其中节点是按需生成的智能体实例,边通过基于内容的信息检索建立语义依赖关系。在长期、复杂任务基准上的实验表明,SAIGE在上下文效率和任务性能之间取得了良好的平衡,并且扩展智能体池或加深递归水平并不总能改善结果。我们的发现表明,多智能体的优势受任务结构限制而非普遍适用,并且更多智能体不一定使系统更智能。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:24

# 重新思考多智能体协作:多者何时反成负担
来源:https://arxiv.org/html/2609.19759
作者:Yibo Wu, Yihan Zhang  
所属机构:上海交通大学  
liujiaheng@nju\.edu\.cn  
Minyuan Sun, Shenliang Li, Xinkai Ma, Yifan Li, Jiaheng Liu  
南京大学  
††脚注文本:†通讯作者。

## 摘要

大型语言模型与单智能体系统(Harness)的快速发展重塑了自主系统的格局,引发了一个关键问题:多智能体协作在何种情况下能提供真正价值。随着单智能体能力的持续扩展,多智能体协作面临收益递减,同时产生日益增长的上下文开销。通过系统性分析,我们界定了多智能体协作相对于单智能体替代方案的能力边界,表明其仅在具有稀疏依赖的长周期任务中带来系统性优势,而在紧密耦合的顺序工作流中,单智能体系统仍然更优。基于这些见解,我们提出了SAIGE——一种基于语义感知增量图演化的轻量级多智能体协作机制。SAIGE将协作建模为动态演化的图,其中节点是按需生成的智能体实例,边则通过基于内容的信息检索建立的语义依赖关系。在长周期复杂任务基准测试上的实验表明,SAIGE在上下文效率和任务性能之间实现了有利的权衡,并且扩大智能体池或加深递归层级并不总能持续提升结果。我们的研究发现表明,多智能体的优势受任务结构约束而非普适,更多智能体并不必然使系统更智能。

## 1 引言

大型语言模型(LLMs)的飞速发展从根本上重塑了自主系统的格局。随着基础模型在处理长周期、复杂任务方面变得越来越强大,相应的智能体系统(如Claude Code(Anthropic, 2025)、Codex(OpenAI, 2025a)和DeepSeek Harness(DeepSeek, 2026a))已发展成高度复杂的基础设施。这些单智能体系统如今能在现实场景中提供稳健的端到端执行能力,为自主性设立了强大的基准。与此形成鲜明对比的是,通用的多智能体协作框架在实践中往往仍停留在玩具级别,局限于简单的基准测试(Paech, 2024; Wang et al., 2024b; Peng et al., 2024)和微小的性能增益(Yun et al., 2026; Alzu'bi et al., 2026)。这种日益扩大的差距促使我们重新审视:在何时以及为何多智能体协作能比装备精良的单智能体系统提供真正价值。

现有工作常将多智能体系统的主要优势归因于上下文隔离,即将任务分区以防止上下文污染和上下文衰变(Huang et al., 2026; Hong et al., 2025)。尽管这种解释直观上具有吸引力,但它在很大程度上仍是定性的,缺乏严格的理论基础。在本工作中,我们旨在通过图论来界定多智能体协作的能力边界。我们将任务轨迹建模为依赖图来形式化多智能体协作,其中子任务由桥接边划分。这种形式化揭示了多智能体协作并非普适的万能药。相反,它仅在具有稀疏依赖的长周期任务中带来系统性优势,在此类任务中,可以利用上下文隔离而不产生过高的协调开销。相反,在紧密耦合的顺序工作流中,单智能体系统仍然更优。

基于这些理论见解,我们提出了SAIGE(Semantic-Aware Incremental Graph Evolution,语义感知增量图演化)——一种优雅且通用的多智能体协作机制。SAIGE将协作建模为动态演化的图,其中节点是按需生成的智能体实例,边则通过基于内容的信息检索建立的语义依赖关系。SAIGE不是预先承诺静态拓扑结构,而是在执行展开时增量增长子任务树,将编排决策建立在实际执行反馈的基础上。

我们在长周期复杂任务基准测试上实证验证了我们的框架,表明与现有通用多智能体方法相比,SAIGE在上下文效率和任务性能之间实现了有利的权衡。值得注意的是,我们的消融研究表明,更大的智能体池或更深的递归层级并不总能提升性能,这表明更多的智能体并不必然使系统更智能。我们的研究发现为理解协作在何种情况下比单智能体执行提供了原则性见解,并表明不加区分的多智能体扩展值得重新考虑。

## 2 相关工作

### 2.1 多智能体协作

多智能体协作规定了智能体如何协调、沟通并调整行为以实现共同目标,其演变从刚性的预定义结构转向自适应、上下文感知的交互。角色分配范围从静态、预先指定的责任(Chen et al., 2025; Fei et al., 2026)到基于任务需求的动态选择或运行时实例化(Wu et al., 2023; Chen et al., 2023; Alzu'bi et al., 2026)。沟通方式同样涵盖通过结构化文档或自然语言的显式消息传递(Hong et al., 2024; Wang et al., 2025c; Mou et al., 2025)以及从环境线索进行的隐式推断(Park et al., 2023; Zou et al., 2026)。信息流进一步将这些交互结构化为顺序管道或并行探索(Shen et al., 2023; Wang et al., 2024a),而交互模式最终体现为合作或竞争动态(Yang et al., 2026; Fu et al., 2023)。

### 2.2 多智能体拓扑结构

多智能体拓扑结构是管理智能体执行、通信和交互的关键结构框架。虽然早期尝试常常隐式地嵌入结构组织(Chan et al., 2023; Wu et al., 2023; Khattab et al., 2023),但近期实践已明确将多智能体组织表示为图(Liu et al., 2024; Zhuge et al., 2024; Qian et al., 2025)。这些拓扑结构通常分为三种代表性范式:集中式、分布式和混合式。集中式拓扑利用全局协调器进行信息聚合和路由(Zhang et al., 2026a; Li et al., 2025);分布式拓扑采用对等通信和本地化路由(Yang et al., 2025; Wang et al., 2025a)以提高自主性和可扩展性;混合拓扑则结合集中式战略规划与分散执行(Qian et al., 2024; Hong et al., 2024; Zhang et al., 2026b)。

具体而言,这些编排策略表现为不同的结构形态,包括链(Qian et al., 2024; Hong et al., 2024; Holt et al., 2025)、星(Wu et al., 2023; Yan et al., 2024)、树(Ishibashi and Nishimura, 2024)和一般图拓扑(Qian et al., 2025; Yun et al., 2026)。

## 3 多智能体协作的形式化

多智能体协作的核心是什么?在何种理想条件下它才真正有益?我们采取一条刻意理想化的路径:我们探究多智能体协作从根本上对任务做了什么,并从该答案推导其益处,将理想与现实之间的差距留作可经验测试的预测来源,而非隐藏的假设。

### 3.1 预备知识

#### 3.1.1 将轨迹建模为依赖有向无环图

考虑一个长度为 \(T\) 的任务轨迹:\(\tau = \{x_1, x_2, \ldots, x_T\}\),其中每个 \(x_t = (o_t, a_t)\) 表示在步骤 \(t\) 的交互元组,由智能体接收到的新观察 \(o_t\) 和采取的动作 \(a_t\) 组成。令 \(\mathcal{H}_t = \{x_1, \ldots, x_{t-1}\}\) 表示在生成 \(x_t\) 之前可用的历史上下文。这个历史记录随 \(t\) 单调增长,智能体的决策可能依赖于该历史记录的任意子集。为了形式化这些依赖关系,我们定义了一个价值函数 \(Q_t(a_t \mid o_t, \mathcal{H}_t)\),表示在历史上下文 \(\mathcal{H}_t\) 下采取动作 \(a_t\) 所带来的预期回报。

对于 \(\tau\) 中的任意一对节点 \(x_i, x_t\)(其中 \(i < t\)),如果满足 \(Q_t(a_t \mid o_t, \mathcal{H}_t) \neq Q_t(a_t \mid o_t, \mathcal{H}_t \setminus \{x_i\})\),则称节点 \(x_t\) 直接依赖于节点 \(x_i\),记为 \(x_i \rightarrow x_t\)。我们进一步假设存在一个阈值 \(\delta > 0\),使得依赖关系在量化上是显著的:\(x_i \rightarrow x_t\) 仅当价值差异超过 \(\delta\) 时才成立,即 \(|Q_t(a_t \mid o_t, \mathcal{H}_t) - Q_t(a_t \mid o_t, \mathcal{H}_t \setminus \{x_i\})| > \delta\),其中 \(\delta > 0\) 是预定义的阈值。由于所有边在时间上都是向前的,该轨迹自然地诱导出一个有向无环图 \(\mathcal{G} = (\mathcal{V}, \mathcal{E})\),节点集 \(\mathcal{V} = \tau\)。每条有向边 \((x_i, x_t) \in \mathcal{E} \subseteq \mathcal{V} \times \mathcal{V}\) 表示节点 \(x_t\) 直接依赖于节点 \(x_i\)。

我们进一步假设任务轨迹不包含冗余交互。具体来说,轨迹中的每个节点至少对一个后续决策有贡献,这意味着在依赖图中每个节点的出度至少为一,终端节点作为唯一的汇聚点。在此假设下,诱导出的 DAG \(\mathcal{G}\) 是弱连通的。这个假设在实践中是温和的,因为任何不影响未来步骤的交互都可以从轨迹中丢弃,而不会影响任务结果。

**图 1 概述**:多智能体协作的理论框架概览。

#### 3.1.2 通过桥接边将轨迹分解为子任务

在 DAG \(\mathcal{G}\) 中,某些边充当连接图不同区域的关键信息通道。边 \((x_i, x_t) \in \mathcal{E}\) 是**桥接边**,如果它的移除会增加 \(\mathcal{G}\) 的弱连通分量的数量。令 \(\mathcal{E}^* \subseteq \mathcal{E}\) 表示所有桥接边的集合。从 \(\mathcal{G}\) 中移除所有桥接边,会将图分解为 \(m\) 个弱连通分量:\(\mathcal{G} \setminus \mathcal{E}^* = \mathcal{C}_1 \cup \cdots \cup \mathcal{C}_m\)。相应的子任务轨迹定义为 \(\mathcal{C}_k\) 中节点的有序序列:\(\tau_{(k)} = \{x_{n_1}, x_{n_2}, \ldots, x_{n_{T_k}}\} \subseteq \tau\),其中 \(T_k = |\mathcal{C}_k|\),子任务轨迹共同划分原始轨迹:\(\tau = \tau_{(1)} \cup \tau_{(2)} \cup \cdots \cup \tau_{(m)}\)。

在多智能体系统中,这种分解具有自然的解释:每个子任务 \(\tau_{(k)}\) 被分配给一个单独的智能体,负责执行该轨迹段。分量之间的桥接边对应于相应智能体之间的通信通道,使得必要时信息可以跨越子任务边界流动。

令 \(\mathcal{V}_\mathcal{S} = \{\tau_{(1)}, \tau_{(2)}, \ldots, \tau_{(m)}\}\) 表示子任务轨迹的集合。子任务之间的有向边由桥接边 \(\mathcal{E}^*\) 诱导产生。由于每条桥接边连接来自不同分量的节点,这产生了一个定义良好的关系:

\((\tau_{(p)}, \tau_{(q)}) \in \mathcal{E}_\mathcal{S} \iff \exists (x_p, x_q) \in \mathcal{E}^* \text{ such that } x_p \in \tau_{(p)} \text{ and } x_q \in \tau_{(q)}\). (2)

配对 \(\mathcal{T} = (\mathcal{V}_\mathcal{S}, \mathcal{E}_\mathcal{S})\) 构成了一个**子任务树**,它在子任务的粒度上捕获信息流。

#### 3.1.3 上下文成本缩减

令 \(c(x)\) 表示在历史上下文中包含交互元组 \(x\) 所产生的非负计算开销。对于子任务轨迹 \(\tau_{(k)} = \{x_{n_1}, \ldots, x_{n_{T_k}}\}\),令 \(\mathcal{B}_k \subseteq \mathcal{E}^*\) 表示进入 \(\tau_{(k)}\) 的桥接边集合,即 \(\mathcal{B}_k = \{(x_p, x_q) \in \mathcal{E}^* \mid x_q \in \tau_{(k)}\}\)。

令 \(\operatorname{idx}(x, \tau)\) 表示节点 \(x\) 在轨迹 \(\tau\) 内的索引。执行子任务 \(\tau_{(k)}\) 的总上下文成本分解为:

\(C(\tau_{(k)}) = C_I(\tau_{(k)}) + C_E(\tau_{(k)}) = \sum_{t=1}^{T_k} \sum_{i=1}^{t-1} c(x_{n_i}) + \sum_{(x_p, x_q) \in \mathcal{B}_k} \sum_{i=\operatorname{idx}(x_q, \tau_{(k)})}^{T_k} c(x_p)\), (3)

其中 \(C_I(\tau_{(k)})\) 计入从同一子任务内节点累积历史上下文的成本,而 \(C_E(\tau_{(k)})\) 计入通过传入的桥接边从前置子任务拉取上下文 \(x_p\) 的成本,从目标节点 \(x_q\) 的位置开始贯穿所有后续步骤。

对于原始的单一轨迹 \(\tau\),没有传入的桥接边,所以 \(\mathcal{B} = \varnothing\),成本简单地为:

\(C(\tau) = \sum_{t=1}^{T} \sum_{i=1}^{t-1} c(x_i)\). (4)

我们的核心主张是,在理想条件下,完整的任务轨迹...

相似文章

多智能体LLMs未能相互探索

Hugging Face Daily Papers

本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。