学习跨域多智能体LLM协作的可迁移拓扑先验
摘要
本文提出TopoPrior框架,该框架从离线参考协作图中学习可迁移的拓扑先验,以生成跨域多智能体LLM协作的初始拓扑,显著降低了在线搜索开销和令牌消耗。
arXiv:2605.17359v1 公告类型:新论文
摘要:基于大型语言模型(LLM)的多智能体系统通过结构化通信协调专业化智能体,在复杂推理方面展现出强大潜力。然而,现有的拓扑演化方法通常为每个查询从头构建或优化协作拓扑,导致大量在线搜索开销、高推理时的令牌消耗以及在多域设置中可扩展性受限。我们提出TopoPrior,这是一个学习跨域多智能体LLM协作的可迁移拓扑先验的框架。TopoPrior并非在线重复搜索有效的协作结构,而是从离线收集的多个域的参考协作图中学习可重用的拓扑先验,并利用它们生成查询条件化的初始协作图,供下游优化。通过将部分拓扑搜索从每个查询的在线优化转移到离线先验学习,TopoPrior分摊了搜索成本,同时保持与现有拓扑演化骨干的兼容性。技术上,TopoPrior包含两个关键组件。首先,可迁移拓扑先验学习模块采用条件变分图框架,在潜在空间中捕获跨域可重用的结构规律。其次,查询条件化潜在适应模块引入对抗对齐,以减少不必要的域差异,同时保留与查询相关的结构变化。在多域推理基准上的实验表明,TopoPrior持续改进了多个异构拓扑演化骨干,同时减少了在线推理时的令牌使用,仅增加了适度的可训练参数。这些结果表明,可迁移的拓扑初始化是一种有效且轻量级的机制,可提高跨域多智能体LLM协作的效率。
查看缓存全文
缓存时间: 2026/05/19 06:39
# 学习跨领域多智能体大模型协作的可迁移拓扑先验 来源: https://arxiv.org/html/2605.17359
陶林张1, 紫杰周2, 九恒万1, 庭源胡3, 程宇王4, 晓峰何3, 日昌洪1
1陶林张, 九恒万, 日昌洪 与 合肥工业大学, 合肥 230002, 中国 \(电子邮件: tlzhang@hfut\.edu\.cn; wan\_jiuheng@163\.com; hongrc@hfut\.edu\.cn\)\.
2紫杰周 与 中国石油大学 \(北京\), 北京 102249, 中国 \(电子邮件: zjzhouzh@gmail\.com\)\.
3庭源胡, 晓峰何 与 华东师范大学, 上海 200062, 中国 \(电子邮件: 10245102409@stu\.ecnu\.edu\.cn; hexf@cs\.ecnu\.edu\.cn\)\.
4程宇王 与 阿里巴巴集团, 杭州 310052, 中国 \(电子邮件: chengyu\.wcy@alibaba\-inc\.com\)\.
通讯作者: 程宇王 和 日昌洪.
###### 摘要
基于大语言模型 (LLM) 的多智能体系统通过结构化通信协调专业智能体,在复杂推理方面展现出强大潜力。然而,现有的拓扑演化方法通常会针对每个查询从头构建或优化协作拓扑,导致大量在线搜索开销、高推理时 token 消耗,以及在多领域设置中扩展性受限。我们提出 **TopoPrior**,一个用于跨领域学习可迁移拓扑先验以支持多智能体 LLM 协作的框架。TopoPrior 并非在线反复搜索有效的协作结构,而是从离线收集的多个领域的参考协作图中学习可复用的拓扑先验,并利用它们生成以查询为条件的初始协作图,供下游进行细化。通过将部分拓扑搜索从每次查询的在线优化转移到离线先验学习,TopoPrior 摊销了搜索成本,同时保持与现有拓扑演化框架的兼容性。技术上,TopoPrior 包含两个关键组件。首先,一个**可迁移拓扑先验学习**模块采用条件变分图框架,在潜在空间中捕获跨领域的可复用结构规律。其次,一个**以查询为条件的潜在适配**模块引入对抗性对齐,以减少不必要的领域差异,同时保留与查询相关的结构变化。在多领域推理基准上的实验表明,TopoPrior 能够持续改进多种异构拓扑演化框架,同时减少在线推理时的 token 使用量,且仅增加少量可训练参数。这些结果表明,可迁移的拓扑初始化是一种有效且轻量级的机制,用于提高跨领域多智能体 LLM 协作的效率。
## I. 引言
基于大语言模型 (LLM) 的多智能体系统通过结构化通信协调多个专业智能体,已成为一种有前景的复杂推理范式。这种范式在多领域设置中尤其具有吸引力,例如医疗保健 [39 (https://arxiv.org/html/2605.17359#bib.bib45)]、科学 [15 (https://arxiv.org/html/2605.17359#bib.bib78),21 (https://arxiv.org/html/2605.17359#bib.bib26)] 和法律 [41 (https://arxiv.org/html/2605.17359#bib.bib77),27 (https://arxiv.org/html/2605.17359#bib.bib75)],在这些领域中,不同的查询可能需要不同的专业知识和协作模式组合。此设置中的一个核心挑战是如何*重用*跨领域的有效协作结构,以便多智能体系统能够适应新任务,而无需反复从头搜索通信拓扑。
现有的多领域 LLM 推理方法大致可分为三类,每类在灵活性、有效性和计算成本方面各有取舍。**免训练提示方法**通过提示工程、少样本示例和思维链推理来适配冻结的 LLM [4 (https://arxiv.org/html/2605.17359#bib.bib9),42 (https://arxiv.org/html/2605.17359#bib.bib24),20 (https://arxiv.org/html/2605.17359#bib.bib23)]。尽管易于部署,但其性能最终受限于底层模型的能力 [57 (https://arxiv.org/html/2605.17359#bib.bib73)]。**基于微调的方法**通过参数更新使模型专门化于目标领域 [46 (https://arxiv.org/html/2605.17359#bib.bib71),35 (https://arxiv.org/html/2605.17359#bib.bib72)],但它们可能遭受灾难性遗忘,并且在涉及多个领域时会引入大量的训练和存储开销 [31 (https://arxiv.org/html/2605.17359#bib.bib11),34 (https://arxiv.org/html/2605.17359#bib.bib21)]。相比之下,**多智能体协作**通过将任务分解到专业智能体之间,并通过通信拓扑组织它们的交互来改进推理。最近的工作已从静态拓扑发展到动态图构建,包括强化学习、基于剪枝和自回归的方法 [18 (https://arxiv.org/html/2605.17359#bib.bib94),36 (https://arxiv.org/html/2605.17359#bib.bib105),54 (https://arxiv.org/html/2605.17359#bib.bib8),55 (https://arxiv.org/html/2605.17359#bib.bib100)]。然而,这些方法大多将拓扑构建视为查询级优化问题,并且通常从头开始搜索,这可能会在多领域设置中导致大量的在线开销、累积的通信噪声以及高推理时 token 消耗 [29 (https://arxiv.org/html/2605.17359#bib.bib15)];见图 1 (https://arxiv.org/html/2605.17359#S1.F1)。
 **免训练方法**依赖冻结的 LLM,最终受限于底层模型的内在能力。\(2\) **训练密集型方法**更新模型参数,但可能遭受灾难性遗忘并在多个领域间产生大量计算开销。\(3\) **多智能体方法**动态构建协作拓扑,但为每个查询从头反复优化图可能产生高昂的在线 token 成本。我们的方法学习可迁移的拓扑先验,为下游拓扑演化提供查询感知的初始化。)
这种局限性激发了一个不同的视角:**与其将每个查询视为一个新的拓扑搜索问题,我们能否离线学习可复用的协作模式,并用它们来初始化下游拓扑演化?** 为此,我们提出 **TopoPrior**,一个用于跨领域学习可迁移拓扑先验以支持多智能体 LLM 协作的框架。其核心思想是将拓扑搜索的部分负担从每次查询的在线图构建转移到离线的跨领域先验学习。TopoPrior 并非针对每个传入查询从头演化一个协作图,而是从跨多个领域收集的参考协作图中学习可复用的拓扑先验,然后利用这些先验生成以查询为条件的初始协作图,供下游进行细化。通过这种方式,TopoPrior 在查询和领域间摊销了部分拓扑搜索成本,同时保持与现有拓扑演化框架的兼容性。
TopoPrior 包含两个关键组件。
\(1\) **可迁移拓扑先验学习**。我们开发了一个条件变分图框架,以捕获跨领域协作图中可复用的结构规律。具体来说,变分编码器将协作图及其关联查询映射到一个潜在空间,而条件生成器从学习到的先验和输入查询中重建以查询为条件的初始拓扑。这种设计使得 TopoPrior 能够建模可在相关领域间重用的协作结构,而不是为每个查询独立地重新学习。
\(2\) **以查询为条件的潜在适配**。虽然可迁移先验可以提高初始化效率,但有效的协作仍然需要对查询相关的结构变化保持敏感。因此,我们引入了一个对抗性潜在适配模块,以减少不必要的领域差异,同时保留依赖于查询的结构特性。结果,生成的拓扑既反映了可重用的协作规律,也体现了任务特定的专门化。
我们在 MMLU [15 (https://arxiv.org/html/2605.17359#bib.bib78)] 和 C-Eval [21 (https://arxiv.org/html/2605.17359#bib.bib26)] 的多领域设置下评估了 TopoPrior。实验结果表明,将 TopoPrior 与现有拓扑演化框架集成,在大多数评估设置中提高了下游性能,将在线推理时的 token 使用量减少了高达 **40.22%**,并且仅为拓扑先验生成器引入了 **3.3M** 额外可训练参数。这些结果表明,可迁移的拓扑初始化是一种有效且轻量级的机制,用于提高跨领域多智能体 LLM 协作的效率。
本文的主要贡献有三点:
- • 我们将多领域设置下多智能体 LLM 系统的拓扑初始化形式化为一个可迁移拓扑先验学习问题,其中可复用的协作结构被离线学习并用于改进下游拓扑演化。
- • 我们提出了 TopoPrior,一个轻量级框架,结合了条件变分拓扑先验学习和以查询为条件的潜在适配,以生成信息丰富的初始协作图。
- • 我们在 MMLU 和 C-Eval 上使用多种拓扑演化框架进行了实验,表明 TopoPrior 在评估的设置中提高了下游推理性能和在线推理 token 效率,且参数开销适中。
## II. 相关工作
### II-A 基于 LLM 的多领域推理
随着 LLM 的兴起,跨多个领域的推理已成为一个日益重要的课题 [26 (https://arxiv.org/html/2605.17359#bib.bib31),5 (https://arxiv.org/html/2605.17359#bib.bib32),43 (https://arxiv.org/html/2605.17359#bib.bib33)]。现有方法主要遵循两种范式。**免训练方法**通过上下文学习、提示工程和思维链推理来适配冻结的 LLM [4 (https://arxiv.org/html/2605.17359#bib.bib9),37 (https://arxiv.org/html/2605.17359#bib.bib28),42 (https://arxiv.org/html/2605.17359#bib.bib24),20 (https://arxiv.org/html/2605.17359#bib.bib23)]。它们易于部署且避免参数更新,但其性能最终受限于底层模型的能力。**训练密集型方法**通过监督微调或参数高效微调(如 LoRA)[19 (https://arxiv.org/html/2605.17359#bib.bib22)] 来适配 LLM。尽管对于领域专门化有效,但它们在涉及多个领域时可能遭受灾难性遗忘,并需要额外的存储和维护 [45 (https://arxiv.org/html/2605.17359#bib.bib103),32 (https://arxiv.org/html/2605.17359#bib.bib30),34 (https://arxiv.org/html/2605.17359#bib.bib21),31 (https://arxiv.org/html/2605.17359#bib.bib11)]。与提示级或参数级适配不同,我们的工作研究了适配的不同维度,即智能体间通信层面的结构适配。具体来说,我们不是修改提示或更新 LLM 参数,而是通过学习多智能体协作的可复用拓扑先验来提高多领域推理效率。
### II-B 多智能体 LLM 系统中的拓扑设计
多智能体 LLM 系统通过通信拓扑组织智能体交互来改进推理。早期方法主要采用预定义的交互模式,包括独立聚合 [23 (https://arxiv.org/html/2605.17359#bib.bib88),56 (https://arxiv.org/html/2605.17359#bib.bib87),10 (https://arxiv.org/html/2605.17359#bib.bib89)]、链式通信 [17 (https://arxiv.org/html/2605.17359#bib.bib95),44 (https://arxiv.org/html/2605.17359#bib.bib93),18 (https://arxiv.org/html/2605.17359#bib.bib94)]、星型协调 [52 (https://arxiv.org/html/2605.17359#bib.bib82),59 (https://arxiv.org/html/2605.17359#bib.bib97)] 和树状层次结构 [22 (https://arxiv.org/html/2605.17359#bib.bib98)]。虽然有效,但当任务需求在输入或领域间变化时,这些固定设计通常缺乏灵活性。更近期的研究动态构建或优化协作图。GPTSwarm [61 (https://arxiv.org/html/2605.17359#bib.bib44)] 和 DyLAN [36 (https://arxiv.org/html/2605.17359#bib.bib105)] 通过强化学习或动态智能体选择来适应智能体交互。基于剪枝的方法移除冗余边或智能体以获得任务自适应的稀疏图 [54 (https://arxiv.org/html/2605.17359#bib.bib8),50 (https://arxiv.org/html/2605.17359#bib.bib39)],而自回归方法生成以输入查询为条件的协作结构 [55 (https://arxiv.org/html/2605.17359#bib.bib100),33 (https://arxiv.org/html/2605.17359#bib.bib47)]。尽管这些方法已显示出强大的推理性能,但它们大多在查询时构建或优化拓扑,并且经常从头开始搜索,导致大量的在线搜索成本和推理时 token 开销。我们的工作是对这一研究方向的补充:我们不是替换下游拓扑演化,而是学习可迁移的拓扑先验,为其提供更强的初始化。
### II-C 可迁移结构学习与图初始化
跨任务或领域重用结构知识对于高效适配至关重要。领域泛化和表示迁移方面的先前工作表明,共享的潜在结构能够支持跨异构设置的迁移 [11 (https://arxiv.org/html/2605.17359#bib.bib69),31 (https://arxiv.org/html/2605.17359#bib.bib11),9 (https://arxiv.org/html/2605.17359#bib.bib41)]。在图表示和生成学习中,变分和条件生成框架已被用于从观测到的图中建模可复用的结构模式 [24 (https://arxiv.org/html/2605.17359#bib.bib91),3 (https://arxiv.org/html/2605.17359#bib.bib40)]。更广泛地说,热启动初始化和结构重用长期以来一直被认为是减少复杂搜索问题中优化成本的实际策略 [14 (https://arxiv.org/html/2605.17359#bib.bib68),2 (https://arxiv.org/html/2605.17359#bib.bib80)]。然而,现有的多智能体 LLM 方法将拓扑构建视为查询级搜索问题,而未学习跨领域的可迁移先验,因此未能摊销可重用的协作模式,并使得图构建依赖于特定查询。相比之下,我们的工作引入了两个关键区别:(1) 学习**可迁移的拓扑先验**用于图初始化,而不是每次查询从头搜索;(2) 将先验学习与以查询为条件的潜在适配相结合,以保留跨领域规律性和查询特定专门化。这种设计在领域间摊销了拓扑搜索成本,并提高了下游效率。
## III. TopoPrior: 框架
在本节中,我们形式化了多领域设置下多智能体 LLM 协作的可迁移拓扑先验学习问题,并介绍了所提出的 TopoPrior 框架。TopoPrior 的概览如图 2 (https://arxiv.org/html/2605.17359#S3.F2) 所示。
### III-A 问题定义
假设我们有来自 \(K\) 个领域的训练数据,表示为 \(\mathcal{D}=\bigcup_{k=1}^{K}\mathcal{D}^{k}\),其中 \(\mathcal{D}^{k}=\{(q_{i}^{k},\mathbb{G}_{i}^{k},y_{i}^{k})\}_{i=1}^{M_{k}}\)。这里,\(q_{i}^{k}\) 是来自第 \(k\) 个领域的一个查询。相似文章
面向多LLM智能体系统上下文自适应的基于图的目标反向传播
本文提出了GTBP,一种用于多LLM智能体系统中上下文自适应的基于图的反向传播框架,它通过理论收敛保证改进了提示优化,并在基准测试中优于现有方法。
基于LLM的多智能体系统中作为收敛压力的关系先验
本文研究了在基于LLM的多智能体系统中,使智能体间关系语义显式化如何充当收敛压力,提高一致性但并不稳定地提升准确性。作者认为,关系先验应被诊断性地、针对具体任务地使用,而非作为默认附加项。
TeamTR:多智能体LLM协调的信任域微调
本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。
超越标记:基于LLM的多智能体系统中潜在通信的统一框架
本文提出了一个基于LLM的多智能体系统中潜在通信的统一框架,按照通信信息内容、发送者-接收者对位和融合技术对方法进行分类,并回顾了2024至2026年间的十八种代表性方法。
拓扑增强的大语言模型对齐:轨迹拓扑损失与拓扑偏好优化
本文介绍了一种用于大语言模型的拓扑增强对齐框架,利用基于持续同调的轨迹拓扑损失和拓扑偏好优化,对隐藏空间中的语义轨迹进行正则化。