学习保留内容:面向多智能体LLM系统高效协作的Gated-Memory Routing

arXiv cs.AI 论文

摘要

本文提出了Gated-Memory Routing,一个用于多智能体LLM系统的框架,该框架使用学习到的门控机制来管理记忆,提高了在推理和代码生成基准测试中的准确性并降低了推理成本。

arXiv:2609.00237v1 公告类型:新 摘要:基于大语言模型(LLM)的多智能体系统通过编排多个智能体的配置和协作方式来处理复杂推理。一个核心挑战是使编排适应不断变化的协作状态。仅从查询进行路由无法适应中间进展或错误,这会影响准确性。从完整的执行历史进行路由提供了缺失的上下文,但迫使后续决策处理每个先前的步骤,包括冗余或低效的步骤。这导致执行历史过载,增加了成本。有效的编排反而需要一个紧凑的状态,该状态能捕获有用的进展而不积累冗余上下文。我们提出了Gated-Memory Routing,它将每个决策基于查询和学习的执行记忆。一个学习的记忆写入门仅提交非冗余的推理步骤,一个学习的检索门为每个智能体提供一个紧凑、相关的子集,因此每个决策都基于一个干净、信息丰富的状态。在每个步骤中,系统从该记忆中选择下一个角色和骨干,而自适应停止控制器在记忆包含足够回答证据时停止执行。在五个推理和代码生成基准测试中,我们的框架既有效又高效:它获得了最佳平均准确性,比最强基线高出2.44分,同时将HumanEval推理成本相对于该基线降低了31.9%。代码可在 https://github.com/rajibrhasan/gated-memory-routing 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:59

# 学习保留内容:面向多智能体大语言模型系统高效协作的门控记忆路由  
来源:https://arxiv.org/html/2609.00237  

###### 摘要  
基于大语言模型 \(LLM\) 的多智能体系统通过协调多个智能体的配置与协作来处理复杂推理任务。其核心挑战在于如何使编排机制适应不断演进的协作状态。仅基于查询的路由无法适应中间进展或错误,影响准确性;而基于完整执行历史的路由虽能提供缺失的上下文,却迫使后续决策处理每个先前步骤——包括冗余或低价值的内容,导致**执行历史过载**并增加成本。有效的编排需要一种紧凑的状态表示,既能捕捉有效进展,又避免累积冗余上下文。我们提出**门控记忆路由**方法,使每个决策基于查询和可学习的执行记忆。其中,学习得到的**记忆写入门控**仅提交非冗余的推理步骤,而**检索门控**则为每个智能体提供紧凑且相关的记忆子集,确保每个决策都基于清晰、信息丰富的状态。在每一步中,系统从此记忆中选择下一个角色与基础模型,同时**自适应中止控制器**在记忆包含足够答案证据时终止执行。在五个推理与代码生成基准测试中,本框架兼具有效性与高效性:平均准确率最优,超越最强基线2.44点,同时将HumanEval推理成本相对降低31.9%。代码已开源:https://github.com/rajibrhasan/gated-memory-routing。  

## 1 引言  
(a)全历史路由  
(b)门控记忆路由  

图1:全历史路由将完整轨迹输入每个决策,增加上下文长度与成本。门控记忆路由则通过写入门控与检索门控维护选择性记忆,并在进一步协作可能无法增值时中止,从而保持上下文相关性与低成本。  

基于大语言模型的多智能体系统已成为处理复杂推理的强大范式:通过将问题分解至专精、批判或相互扩展推理的智能体,在推理与代码生成基准测试中表现出色[Chen et al. (2024c)](https://arxiv.org/html/2609.00237#bib.bib22)、[Liang et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib11)、[Zhang et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib13)、[Qian et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib12)。其效能不仅依赖底层大语言模型,更取决于**编排方式**:调用多少智能体、分配何种角色、使用何种基础模型以及每个智能体可访问哪些信息。这些决策构成了**路由**问题,决策质量直接决定协作是带来真实推理增益还是冗余计算。  

早期多智能体系统通过固定、手工设计的路由方式解决这一问题:实例化预定义智能体,手动指定角色与静态协作模式,且模式在查询间保持不变[Hong et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib21)、[Qian et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib20)、[Li et al. (2023)](https://arxiv.org/html/2609.00237#bib.bib14)、[Du et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib19)、[Wu et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib15)。为缓解这种僵化,后续工作通过优化或剪枝通信图使交互结构自适应化[Zhuge et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib4)、[Zhang et al. (2025a)](https://arxiv.org/html/2609.00237#bib.bib5)、[Wang et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib6)、[Liu et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib23),而端到端路由器则直接根据查询配置智能体数量、角色与基础模型[Yue et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib10)。这类**仅基于查询**的路由器在智能体产生推理前即确定路由决策,因而无法响应局部进展、错误或解决方案中浮现的缺口。  

近期另一种方法基于动态执行状态进行路由,根据演进的任务状态对智能体进行排序[Dang et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib30)。然而,若这种动态状态未经充分过滤直接传递,每个决策就必须在无差别、不断增长的上下文中推理——其中混合了有用证据与冗余或错误的推理;这种**全历史路由**使下游智能体暴露于低价值上下文,并推高推理成本。  

这两种方法存在相反的局限:仅基于查询的路由观察信息过少,在执行开始前即做出决策,影响准确性;而基于完整执行历史的路由(图1(a))观察信息过多,迫使每个决策处理未过滤且不断增长的轨迹,增加成本。路由器应学习保留什么、呈现什么以及如何基于结果状态行动。  

这促使我们基于**结构化、选择性记忆**进行路由(图1(b)):系统基于门控记忆动态路由,仅向下游智能体暴露步骤相关上下文,并仅提交值得保留的推理步骤。这些决策紧密耦合:低质量写入会污染后续检索,过于宽泛的检索会分散下游智能体注意力,而固定深度执行可能过早停止或在额外推理无益时继续消耗计算资源。  

基于此观点,我们引入**门控记忆路由**框架,其中可学习的门控执行记忆作为共享状态,供所有路由决策使用。一个联合训练的路由器通过互补组件作用于该记忆:**历史感知角色分配器**与**LLM路由器**选择智能体及其基础模型;**检索门控**呈现紧凑的步骤相关记忆子集;**记忆写入门控**仅提交高价值、非冗余的推理步骤;**自适应中止控制器**决定门控状态是否足以停止。由于路由由门控记忆而非原始历史驱动,交互结构在执行过程中动态涌现。  

#### 贡献  
- **基于学习门控记忆的路由**:我们将多智能体编排重构为基于学习得到的选择性执行记忆的路由:每个步骤基于过滤后的任务相关状态,而非仅查询或原始执行历史。  
- **记忆管理与预算感知中止**:学习的写入与检索门控控制记忆存储与呈现内容,保持状态紧凑且高信息量;预算感知的中止策略利用该干净状态控制推理深度与成本,所有组件通过群组相对、成本感知目标进行端到端训练,与角色及基础模型路由联合优化。  
- **实证有效性与高效性**:在MATH、GSM-Hard、MBPP、HumanEval与MMLU-Pro基准测试中,门控记忆路由达到最佳平均准确率,超越最强基线2.44点,同时将HumanEval推理成本相对降低31.9%。  

## 2 相关工作  
#### 固定与基于角色的多智能体系统  
代表性基于大语言模型的多智能体系统通过预定义角色与静态交互图设计协作:MetaGPT[Hong et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib21)通过标准操作规程强制基于角色的工作流;ChatDev[Qian et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib20)将软件开发建模为固定线性链。这些系统展示了专业化的价值,但其通信模式在执行前即固定,无法随执行进展调整参与智能体、上下文或深度。  

#### 自适应拓扑与图优化  
多种方法通过调整交互结构或优化通信图使工作流更灵活:GPTSwarm[Zhuge et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib4)通过可学习提示优化编排;AFlow[Zhang et al. (2025b)](https://arxiv.org/html/2609.00237#bib.bib18)搜索可执行工作流;AgentPrune[Zhang et al. (2025a)](https://arxiv.org/html/2609.00237#bib.bib5)与AgentDropout[Wang et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib6)通过剪枝预定义模板中的连接或智能体诱导稀疏性;DyLAN[Liu et al. (2024)](https://arxiv.org/html/2609.00237#bib.bib23)更进一步,在推理期间通过同行评估与共识剪枝低贡献智能体;OMAC[Li et al. (2026)](https://arxiv.org/html/2609.00237#bib.bib37)联合优化智能体功能与协作结构。这些方法通过优化参与智能体及其连接方式提高灵活性,但未学习后续编排决策应基于哪些中间信息;例如DyLAN通过移除智能体适应变化,但仍传递剩余智能体的未过滤输出。  

#### 查询级LLM与多智能体系统路由  
大语言模型路由优化模型成本与能力间的权衡:RouteLLM[Ong et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib8)、RouterDC[Chen et al. (2024b)](https://arxiv.org/html/2609.00237#bib.bib9)、R2-Router[Xue et al. (2026)](https://arxiv.org/html/2609.00237#bib.bib40)、HW-Router[Kabir et al. (2026)](https://arxiv.org/html/2609.00237#bib.bib41)、Securerouter[Zhang et al. (2026)](https://arxiv.org/html/2609.00237#bib.bib42)与FrugalGPT[Chen et al. (2024a)](https://arxiv.org/html/2609.00237#bib.bib7)将每个查询路由至成本效益模型。在多智能体系统中,MASRouter[Yue et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib10)训练强化学习策略,根据输入查询配置执行组件,包括智能体数量、角色分配与基础模型选择。这些方法使路由更具成本意识与任务适应性,但决策主要基于查询而非展开的执行轨迹,因而无法根据中间轨迹元素的质量、新颖性或冗余度调整编排。  

#### 基于执行历史的路由  
近期工作通过基于动态执行状态的编排来解决仅查询路由的局限:Evolving Orchestration[Dang et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib30)使用强化学习训练中央编排器,根据动态执行状态选择智能体并通过指定停止动作终止执行。这使路由能响应执行,但状态保留未经充分过滤的累积轨迹,导致中间元素传递至后续决策。这种全历史路由可能随着执行深入导致执行历史过载,迫使后续决策处理冗余、嘈杂或低价值的中间内容。我们的框架通过门控执行记忆进行路由,每个决策基于过滤后的状态而非未过滤历史,在表1的基准测试中以平均2.44点优势超越Evolving Orchestration。  

我们的自适应中止也与自适应计算[Graves (2016)](https://arxiv.org/html/2609.00237#bib.bib36)和早期退出推理相关,这些技术学习何时在单一模型内停止计算;相比之下,本方法基于门控记忆状态终止多智能体协作。  

#### 记忆优化的智能体架构  
记忆管理是智能体系统的核心组件:MemGPT[Packer et al. (2023)](https://arxiv.org/html/2609.00237#bib.bib24)通过虚拟内存层次结构将信息分页进出上下文;AIOS[Mei et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib25)将记忆作为智能体共享的操作系统级资源管理;A-mem[Xu et al. (2025)](https://arxiv.org/html/2609.00237#bib.bib26)与MM[Hatalis et al. (2023)](https://arxiv.org/html/2609.00237#bib.bib27)等系统通过分类与检索组织记忆;Memory-R1[Yan et al. (2026)](https://arxiv.org/html/2609.00237#bib.bib38)使用强化学习训练智能体在长期记忆中的写入与检索策略。这些系统主要将记忆视为存储与检索基底,优化在上下文预算下应保留或召回的信息。相比之下,门控记忆路由将多智能体轨迹内的查询执行记忆视为主动控制信号:写入与检索决策与角色分配、基础模型路由及中止在任务级奖励下联合训练,使记忆不仅提供上下文,还决定谁执行下一步、读取什么内容以及何时停止协作。  

## 3 方法论  
图2:门控记忆路由框架  
在每一步 \(t\) 中,系统基于查询与当前执行记忆构建状态 \(s_t = (q, S_{t-1})\)。角色分配器与LLM路由器配置下一个智能体,检索门控提供相关记忆上下文,写入门控决定新执行记录是否进入记忆。中止控制器要么继续循环,要么将存储记录传递至聚合器LLM以生成最终答案。  

### 3.1 问题定义  
我们将门控记忆路由形式化为基于智能体专业集合 \(\mathcal{R}\)、异构大语言模型基础模型池 \(\mathcal{M}\) 与单查询执行内维护的执行记忆 \(S_t\) 的序列决策过程。在步骤 \(t\),可观察状态为 \(s_t = (q, S_{t-1})\),其中 \(S_{t-1}\) 保存先前步骤保留的执行记录。系统选择专业 \(r_t \in \mathcal{R}\) 与基础模型 \(m_t \in \mathcal{M}\),检索上下文子集 \(C_t \subseteq S_{t-1}\),生成推理步骤 \(y_t\),并决定是否提交记录 \(e_t = (r_t, m_t, y_t)\),使记忆演变为轨迹的门控子集 \(S_t \subseteq \{e_i\}_{i=1}^{t}\)。该过程在达到实现深度 \(L \in \{1, \dots, \phi\}\) 时终止,触发条件为中止策略生效或达到最大深度 \(\phi\);由于每步后均评估中止,至少有一个智能体执行。聚合器随后从终端状态 \(S_L\) 生成最终答案。全文中,粗体表示量的冻结句子嵌入(例如 \(\mathbf{q} = \operatorname{enc}(q)\))。  

#### 聚合器提示:HumanEval与MBPP  
系统:扮演其他智能体输出的决策者,识别错误,并以仅包含代码的单个Python代码块返回答案。  
用户:根据函数签名与文档字符串,结合任何先前设计或实现,用一个Python代码块编写完整实现(重述签名)。  

#### 聚合器提示:MMLU-Pro  
系统:扮演其他智能体答案与分析的决策者,识别错误。  
用户:从十个选项(A到J)中选择唯一正确答案,以如下格式结尾:

相似文章

Σ-Mem:面向基于LLM的多智能体系统的在线可靠性记忆

Hugging Face Daily Papers

本文介绍了Σ-Mem,一种用于基于LLM的多智能体系统的在线可靠性记忆,它跟踪同伴的历史能力表现及同伴之间的关系,通过谱界实现稳定自适应,并通过残差引导、路由和加权投票来改善协调性。

多智能体LLM系统的受控共享内存

arXiv cs.AI

本文介绍了MemClaw,一种用于多智能体LLM系统的受控共享内存架构,形式化了诸如未授权泄漏和过时传播等故障模式,并通过ArgusFleet测试框架评估了该系统。