多智能体LLM工作流的推理时图工程

arXiv cs.AI 论文

摘要

本文介绍了ReActNet,一个无需训练的框架,为多智能体LLM系统合成任务条件化的时序工作流图,提升协调性和性能,超越固定或学习拓扑的基线。

arXiv:2609.05774v1 公告类型: 新 摘要:近年来,多智能体LLM系统越来越依赖图结构化通信来协调专门化智能体。我们从图工程视角重新审视多智能体编排:与其优化静态拓扑,我们合成任务条件化的时序工作流图,共同指定智能体连通性和边级通信语义。我们引入ReActNet,一个无需训练的框架,将查询和一组角色专门化智能体编译为有向通信图序列。每个图快照对应一个推理阶段,每个边携带自然语言指令,指定源智能体应向目标智能体提供的消息。编译后的时序图随后通过结构化消息传递执行:智能体通过整合其先前状态与控制器分配的邻居消息来更新其推理状态,最终聚合器将产生的状态综合为答案。此设计将图编译与图执行分离,使多智能体协调显式、可检查且任务条件化,无需强化学习或基于梯度的拓扑优化。在知识推理、数学问题解决、代码生成和GAIA风格的辅助任务中,ReActNet持续超越固定拓扑和学习拓扑基线,同时保持有竞争力的推理成本。这些结果表明,有效的多智能体编排不仅取决于哪些智能体通信,还取决于工程化可执行的工作流图,这些图编码了推理过程中信息应何时、为何以及如何流动。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:41

# 多智能体大语言模型工作流的推理时图工程
来源:https://arxiv.org/html/2609.05774
Katherine Tieu、董其富  单位:Meta、应龙翔  单位:Meta、李红  单位:Meta、严红  单位:Meta(工作于Meta)、何敬睿  单位:伊利诺伊大学厄巴纳-香槟分校

###### 摘要
近年来,多智能体大语言模型系统日益依赖图结构通信来协调专业化智能体。本文从图工程的角度重新审视多智能体编排问题:我们不再优化静态拓扑,而是合成一个任务条件的时序工作流图,该图联合定义了智能体连接性及边级通信语义。我们提出ReActNet,这是一个无需训练的框架,可将查询和一组角色专用智能体编译为一系列有向通信图。每个图快照对应一个推理阶段,每条边携带自然语言指令,指定源智能体应向目标智能体传递的消息。编译后的时序图通过结构化消息传递执行:智能体通过整合先前状态与控制器分配的邻居消息来更新推理状态,最终聚合器将所得状态综合为答案。该设计将图编译与图执行分离,使多智能体协调显式化、可检查且任务条件化,无需强化学习或基于梯度的拓扑优化。在知识推理、数学问题求解、代码生成和GAIA风格助手任务中,ReActNet在保持有竞争力推理成本的同时,持续优于固定拓扑和学习拓扑基线。这些结果表明,有效的多智能体编排不仅取决于哪些智能体进行通信,还取决于设计可执行的工作流图来编码推理过程中信息何时、为何以及如何流动。

††日期:2026年9月4日## 1引言

大语言模型(LLMs)催生了一类新型多智能体系统,其中多个角色专用智能体通过迭代推理和通信协作解决复杂任务(Guo等,2024;Tran等,2025;Wei等,2026;Ning等,2026)。此类系统的核心设计问题是*如何组织协作*:哪些智能体应参与,它们应在何时通信,彼此间应传递何种信息,以及中间推理状态如何综合为最终答案。现有大语言模型多智能体系统通常通过指定或学习通信拓扑来解决这一问题,其中节点代表智能体,边定义可能的信息流动。代表性设计包括手动指定的结构(如链、树、星型、完全图和随机图)(Du等,2023;Qian等,2024),以及适应任务的学习或优化图结构(Zhuge等,2024;Zhang等,2024;Zhang等,2025)。

尽管图结构通信提升了多智能体协调能力,但大多数现有方法仍以拓扑为中心。即它们主要优化通信图的邻接模式(即谁可以与谁通信),而将可执行的协作协议视为隐含部分。然而,有效的多智能体推理不仅依赖于拓扑。实际上,协作图不仅应指定哪些智能体交换信息,还应明确每条通信边的推理功能、通信发生的求解阶段,以及产生的推理状态如何传播和聚合。例如,从程序员到验证者的边不应仅表示允许通信;它应指定程序员应提供代码、暴露失败案例、解释算法不变性,还是回应批评。

这促使我们从图工程的视角审视大语言模型多智能体编排:核心对象不再是静态通信拓扑,而是一个可执行的工作流图,它联合定义智能体、通信路径、推理阶段结构、边级指令和状态更新。这样的工作流图使多智能体协调显式化且可检查:节点对应角色专用智能体,有向边传递中间信息,时序图快照表示不同推理阶段,边属性指定每个源智能体的预期语义贡献。这一视角将设计目标从学习图骨架转向合成任务条件的协作协议。

本文提出ReActNet,这是一个在多智能体大语言模型系统中用于推理时工作流图合成的无需训练的框架。ReActNet不学习静态拓扑,而是使用大语言模型控制器作为图编译器,将输入查询和一组角色专用智能体映射为*指令型时序工作流图*。每个图快照对应一个推理阶段,每个有向边携带自然语言指令,指定源智能体应向目标智能体传达的内容。编译后的图随后通过结构化消息传递执行:每个智能体通过整合先前推理与来自控制器分配邻居的传入消息来更新其推理状态,最终综合节点将各智能体的最终状态聚合为答案。

该公式将*图编译*与*图执行*分离。在图编译阶段,控制器对智能体、推理阶段和边级通信语义进行任务条件规划。在图执行阶段,智能体遵循编译后的时序图,无需额外训练或基于梯度的优化。这种设计使多智能体协调显式化、模块化且可解释,同时保留了基于大语言模型推理的灵活性。

实验表明,ReActNet在知识推理、数学问题求解、代码生成和GAIA风格助手任务中持续优于固定拓扑和学习拓学习拓扑基线。改进是在无训练阶段令牌成本且推理时间效率有竞争力的情况下实现的。进一步分析显示,ReActNet生成*阶段感知的时序图*:早期轮次倾向于支持分解和信息收集,中间轮次强调计算和交叉验证,最终轮次关注一致性检查和答案综合。这些结果表明,多智能体性能不仅取决于选择通信拓扑,还取决于设计可执行的工作流图来编码推理过程中信息何时、为何以及如何流动。

我们的贡献包括:
- •将大语言模型多智能体协调形式化为*推理时工作流图合成*,将重点从拓扑优化转向图工程化的协作协议。
- •引入*指令型时序工作流图*,其中每个有向边同时指定通信路径和自然语言推理指令,从而统一图结构与通信语义。
- •提出ReActNet,这是一种无需训练的控制器-执行器架构,可编译任务条件时序图,并通过角色专用智能体之间的结构化消息传递执行,在多样化推理和生成基准测试中实现优异性能。

## 2预备知识

多智能体交互图。我们将多智能体交互建模为离散时间图𝒢={𝒢⁽ᵗ⁾}ₜ₌₁ᵀ,定义为T个图快照的有序序列。每个快照𝒢⁽ᵗ⁾=(𝒱, ℰ⁽ᵗ⁾)共享固定节点集𝒱,其中|𝒱|=N,而边集ℰ⁽ᵗ⁾在时间戳间变化,以编码第t轮的通信结构。每个节点vᵢ∈𝒱对应系统中的角色专用智能体𝐀⁽ⁱ⁾。有向边eₜ⁽ʲ→ⁱ⁾∈ℰ⁽ᵗ⁾表示智能体j在第t轮向智能体i发送有向交互。我们定义智能体i在时间t的时序邻域为ℕᵢ⁽ᵗ⁾={j | eₜ⁽ʲ→ⁱ⁾∈ℰ⁽ᵗ⁾}。

边属性作为控制器指令。每条有向边eₜ⁽ʲ→ⁱ⁾携带关联属性,作为控制器发出的指令,指定智能体j在第t轮应向智能体i传达的内容。关键的是,完整的时序图{𝒢⁽ᵗ⁾}ₜ₌₁ᵀ及所有边属性{eₜ⁽ʲ→ⁱ⁾},均由基于大语言模型的控制器在智能体交互前一次性生成。这种一次性生成使控制器能够预先规划整个多轮通信协议,无需迭代反馈或额外训练。控制器及其在构建时序图中的角色的详细定义见下一节。

## 3方法论

ReActNet将多智能体协调分为两个阶段:指令型时序工作流图的*编译*与*执行*。在编译阶段,大语言模型控制器将输入查询和可用智能体角色映射为指令型时序工作流图。在执行阶段,角色专用智能体遵循编译后的图进行结构化消息传递,多轮更新其推理状态,最终综合节点生成答案。完整提示词见附录A。ReActNet的完整工作流程伪代码见附录D。

参见标题图1:ReActNet作为编译后执行的图编排。给定查询和智能体角色描述,控制器首先编译指令型时序工作流图。然后通过角色专用智能体间的结构化消息传递多轮执行该图,最后综合节点生成答案。这种编译后执行的设计与拓扑学习方法不同。ReActNet不是通过优化学习任务无关的图生成器,而是在推理时合成任务条件图。此外,ReActNet将自然语言指令嵌入每条有向边,而非将通信表示为无类型的邻接模式,指定源智能体应提供给目标智能体的推理贡献。因此,图不仅编码*谁与谁通信*,还编码*应传达什么信息*以及*在哪个推理阶段*。

### 3.1概述:编译后执行编排

给定查询q、N个角色专用智能体{𝐀⁽ⁱ⁾}ᵢ₌₁ᴺ和T轮交互预算,ReActNet构建时序工作流图𝒲_q={𝒢⁽ᵗ⁾}ₜ₌₁ᵀ,其中每个图快照𝒢⁽ᵗ⁾定义推理轮次t的通信工作流。每个节点对应一个智能体,每个有向边指定从源智能体到目标智能体的指令型通信事件。

ReActNet分三阶段进行。首先,控制器将查询和智能体角色描述编译为时序工作流图。其次,智能体通过消息传递执行图,每个智能体使用先前状态及从传入邻居收到的消息更新其推理状态。最后,最终综合节点聚合所得智能体状态并生成答案。

### 3.2角色专用智能体作为工作流节点

我们将每个智能体𝐀⁽ⁱ⁾实例化为基于角色提示p₍role₎⁽ⁱ⁾的大语言模型。每个角色提示定义智能体在工作流中的功能视角,如求解、编程、验证、批评、领域知识或综合。在工作流图中,智能体充当可执行的推理节点:当被传入消息激活时,智能体根据其角色、原始查询、先前状态和收到的消息生成更新后的推理状态。

为给控制器提供可用工作流节点的完整描述,我们通过拼接角色描述构建多智能体系统提示:
p₍MAS₎ = "系统由N个智能体组成,各智能体的角色为:" ⊕ {p₍role₎⁽ⁱ⁾}ᵢ₌₁ᴺ
其中⊕表示字符串拼接。

### 3.3控制器作为推理时图编译器

控制器是初始化了查询q和角色提示p₍role₎₍controller₎的大语言模型,该提示指导其为可用智能体设计多轮协作协议。我们将控制器解释为推理时图编译器:给定查询、智能体角色描述和交互预算,它在执行开始前合时序工作流图。

形式上,控制器F₍controller₎在一次前向传递中生成完整时序工作流图:
𝒲_q = {𝒢⁽ᵗ⁾}ₜ₌₁ᵀ = F₍controller₎(p₍role₎₍controller₎; T; p₍MAS₎; q)

之后,每个快照𝒢⁽ᵗ⁾=(𝒱, ℰ⁽ᵗ⁾, ξ⁽ᵗ⁾)包含对应智能体的固定节点集𝒱、时间相关有向边集ℰ⁽ᵗ⁾及边指令集ξ⁽ᵗ⁾。与观察实时中间状态后重新生成图的在线重规划方法不同,ReActNet预先编译完整时序图。这种一次性编译允许控制器生成全局一致的多轮工作流,同时避免额外训练或迭代图优化。

### 3.4指令型边

ReActNet的一个显著特征是边不仅是二元通信链接。每条有向边都是指令型的:
eⱼ→

相似文章

GraphReAct:面向多步图推理的推理与行动

arXiv cs.AI

本文介绍了 GraphReAct,这是一个将推理与行动范式扩展到图结构数据以进行多步推理的框架。它结合了拓扑检索、语义检索以及上下文精炼,以提升在图学习基准测试上的性能。