面向多智能体系统的工作负载感知缓存
摘要
本文提出了一种面向多智能体系统的工作负载感知缓存逐出策略,该策略利用重新计算成本、DAG依赖计数和智能体调用频率来保留有价值的缓存条目,相比于无缓存基线最多可将延迟降低64.7%,相比于次优的有限容量方法平均可降低31.1%。
查看缓存全文
缓存时间: 2026/07/24 05:03
# 面向多智能体系统的工作负载感知缓存 来源:https://arxiv.org/html/2607.20495 ###### 摘要 多智能体系统将复杂任务分解为有向无环图(DAG)形式的专业智能体执行序列,这在跨查询执行过程中自然提供了缓存中间结果的机会。然而,现有的缓存淘汰策略基于访问历史对所有缓存条目一视同仁,忽略了智能体执行环境中独有的结构信号和工作负载信号。我们提出了一种工作负载感知的淘汰策略,该策略将重计算成本、DAG依赖计数和智能体调用频率三个信号结合成一个统一的评分函数,从而在内存约束下保留最有价值的条目。在三个覆盖不同重用模式的多智能体基准测试上,我们的策略相比无缓存基线将延迟降低了高达64.7%,相比次优的有限容量基线平均降低延迟31.1%,同时性能逼近无限缓存,并且准确率优于或等同于所有竞争的有限容量方法。我们进一步表明,工作负载感知的内容缓存与其他智能体系统优化方法(包括计划级缓存和并行智能体执行)是互补的,每种技术针对多智能体流水线中不同的效率瓶颈。 ## I 引言 AI系统正从单一模型架构转向复合系统,即使用并协调不同的专业智能体、工具和推理步骤来解答查询。多智能体系统已在软件工程、科学研究、自主决策等多个领域展现出能力[9 (https://arxiv.org/html/2607.20495#bib.bib29), 3 (https://arxiv.org/html/2607.20495#bib.bib37), 15 (https://arxiv.org/html/2607.20495#bib.bib44), 31 (https://arxiv.org/html/2607.20495#bib.bib35), 33 (https://arxiv.org/html/2607.20495#bib.bib30), 30 (https://arxiv.org/html/2607.20495#bib.bib38)]。然而,这种架构转变也带来了效率挑战,随着智能体交互因更复杂的计划而日益复杂,计算成本可能限制其在现实世界的实际部署。现代推理模型的推理成本,加上每个查询需要多次智能体调用,使得每一次冗余计算都代价高昂[14 (https://arxiv.org/html/2607.20495#bib.bib43)]——不仅体现在延迟上,也体现在资源利用上。 多智能体工作负载在不同查询之间可能存在大量的计算重叠。当不同查询共享共同的运算模式时,这种冗余就会出现。例如,在财务分析中,诸如“公司X的收入是多少?”和“公司X的利润率是多少?”之类的查询,都共享相同的初始步骤,如检索财务报表、解析文档和提取标准字段,仅在最终计算上有所不同。类似地,要求摘要与数据集描述的文档分析查询,可能共享相同的解析、章节识别和实体提取操作。这种模式不仅限于精确重复。结构相似的查询,如“分析2023年第一季度业绩”和“分析2023年第二季度业绩”,可能仅在日期过滤器上不同,但共享数据聚合、规范化和可视化逻辑。 许多现代多智能体系统使用基于DAG的计划,其中专业规划智能体将任务分解为结构化的执行计划(图1 (https://arxiv.org/html/2607.20495#S1.F1))。这些计划表示为有向无环图,其中节点对应计算任务(LLM调用、工具执行、数据处理),边编码这些任务之间的依赖关系。然后,执行器派发智能体完成任务,同时遵守依赖关系。这种将任务分解为可复用计算单元的做法,自然带来了缓存机会——如果我们缓存节点结果,当类似查询需要相同操作时,就可以复用它们。然而,无限缓存会迅速耗尽可用内存,这就需要制定淘汰策略来决定保留哪些缓存结果。 参见图注 图1:网络监控的多智能体工作流,表示为DAG。节点由专业智能体完成的步骤,边编码依赖关系。A) 遥测数据收集,B) 数据解析与标准化,C) 指标聚合与计算,D) 容量/使用情况分析,E) 异常检测,F) SLA策略评估,G) 仪表盘与告警更新。代价高昂的操作可从缓存中显著获益。 传统的淘汰策略,如最近最少使用(LRU)或最不经常使用(LFU),完全基于访问历史做出决策,使用时间或频率等指标,对所有缓存项一视同仁。这种方法虽有效,但忽略了多智能体规划系统中可用的几个结构信号和工作负载信号。例如,考虑一个容量已满的缓存,其中有两个节点。节点A在30秒前被访问,馈送给1个下游计算(因此它有一条出边),重计算需要0.3秒。节点B在5分钟前被访问,馈送给4个下游节点,并且由于昂贵的数据库查询和文档解析,重计算需要8秒。LRU根据较晚的访问时间淘汰节点B。当下一个查询到来,需要节点B的输出而非节点A时,系统必须重新计算(8秒)。如果淘汰节点A,代价仅为0.3秒。这只是统一对待未能识别节点B的结构重要性(馈送给多个依赖项)和高重计算成本使其更有保留价值的一个例子。除了结构考量,传统策略也没有利用工作负载模式。当用户探索相关问题(例如,分析同一公司的不同指标,或针对同一测试套件测试代码变体)时,基于查询相似性,某些DAG子图会暂时变得更有价值。一个了解这些语义模式的策略,可以优先保留可能在将来查询中被重用的节点。 本文介绍了一种专门为多智能体系统设计的工作负载感知、结构信息感知的缓存淘汰策略。我们的方法考虑了大多数传统策略忽略的三个维度。(1) 节点在DAG结构中的拓扑重要性,(2) 重计算被淘汰节点的计算成本,(3) 基于观察到的负载模式,未来重用的可能性。通过将这些信号结合成一个统一的评分函数,我们的策略相对于无缓存基线将延迟降低高达64.7%,同时在多样化的多智能体工作负载下性能逼近无限缓存。我们还分析了我们的方法如何与互补的多智能体效率技术交互,发现工作负载感知的内容缓存、计划级缓存和并行智能体执行是相互增强的。总体而言,我们的贡献如下: - C1 工作负载感知淘汰策略。一种针对多智能体系统的缓存淘汰策略,将重计算成本、DAG依赖计数和智能体调用频率结合成一个统一的评分函数,从而实现有原则的淘汰决策。 - C2 实证评估。在三个覆盖不同重用模式的多智能体基准测试上进行了全面评估,证明相对于标准淘汰基线,在延迟、吞吐量和准确性方面有一致的改进。 - C3 淘汰质量分析。一项分析表明,在异构智能体工作负载中,淘汰质量(而不仅仅是命中率)也是延迟收益的主要驱动因素,我们的策略持续淘汰比所有竞争方法更便宜的条目。 - C4 智能体优化研究。对工作负载感知缓存如何与互补技术(包括计划级缓存和并行智能体执行)交互的调查,揭示了协同效应。 ## II 背景与相关工作 我们将相关工作组织为三个领域:基于LLM的智能体的缓存技术、使用DAG的工作流抽象,以及高效的多智能体系统编排。 ### II-A LLM智能体中的缓存 随着基于LLM的智能体在复杂性和部署规模上的增长,缓存已成为不同抽象层次上的主要优化技术。我们按照缓存计算工件的粒度来组织这些方法。 ##### KV缓存 KV缓存指的是缓存来自Transformer注意力计算的键值张量[29 (https://arxiv.org/html/2607.20495#bib.bib41)]。vLLM[12 (https://arxiv.org/html/2607.20495#bib.bib5)]和SGLang[40 (https://arxiv.org/html/2607.20495#bib.bib6)]等现代服务系统引入了分页存储和基数树组织以实现高效的KV缓存管理,当GPU内存受限时通常采用基于LRU的淘汰策略。近期工作专门针对多智能体系统对此进行了扩展。KVFlow[20 (https://arxiv.org/html/2607.20495#bib.bib4)]引入了工作流感知的淘汰策略,使用智能体步骤图来预测执行顺序,为每个智能体分配一个“距执行步骤数”值,估计其距未来激活的时间接近度,并淘汰那些不太可能立即运行的智能体的缓存。KVCOMM[34 (https://arxiv.org/html/2607.20495#bib.bib7)]解决了一个互补的挑战,通过维护一个锚点池来存储在不同前缀下观察到的KV缓存偏移偏差,从而支持在不同前缀上下文的智能体之间共享KV缓存,实现缓存复用。 ##### 语义与工具级缓存 更高级别的系统基于查询相似性(而非精确匹配)来缓存LLM输出。GPTCache[1 (https://arxiv.org/html/2607.20495#bib.bib8)]开创了基于嵌入的语义缓存,用于LLM应用,使用相似性搜索[10 (https://arxiv.org/html/2607.20495#bib.bib40)]来复用语义相关查询的响应。在此基础上,Cortex[23 (https://arxiv.org/html/2607.20495#bib.bib9)]将语义缓存扩展到智能体工作负载中的工具输出,通过语义感知的知识缓存来解决跨区域数据访问延迟问题。这些方法(以及类似的方法)针对单个LLM或工具调用,在类似查询再次出现时减少冗余计算。 ##### 计划与推理级缓存 最高级别针对智能体执行的计划和推理阶段。智能体计划缓存[39 (https://arxiv.org/html/2607.20495#bib.bib10)]从完成的执行中提取结构化的计划模板,存储可泛化的工作流,这些工作流可以通过基于关键词的匹配和轻量级模板适配,适应具有类似任务意图的新查询。诸如SemanticALLI[4 (https://arxiv.org/html/2607.20495#bib.bib11)]中的方法对此进行了补充,通过在分析流水线中的多个检查点缓存中间推理表示,将结构化的推理状态视为一流的可缓存工件。这些方法在根本不同的粒度上运行。KV缓存方法优化推理延迟,语义缓存针对单个调用,而计划级系统减少规划开销。我们的工作引入了任务执行结果级别的缓存。 ### II-B 表示为DAG的工作流 有向无环图自然地表达了具有显式依赖关系的计算工作流,从而能够在多个领域进行依赖感知的优化。 ##### 数据分析系统。 DAG感知的缓存出现在批处理作业中,这些作业将自身分解为具有数据依赖关系的阶段。LRC[35 (https://arxiv.org/html/2607.20495#bib.bib12)]为Apache Spark[37 (https://arxiv.org/html/2607.20495#bib.bib39)]引入了基于引用计数的淘汰策略,优先保留拥有最多未计算子节点(这是一个比基于时间或频率的策略更好的未来效用指标)的缓存数据块。LERC[36 (https://arxiv.org/html/2607.20495#bib.bib14)]对此进行了扩展,引入了尊重“全有或全无”属性的协调淘汰策略,即只有当所有输入依赖项都保留在内存中时,任务才能从缓存中受益。类似的方法优化了物化视图和分布式查询执行[13 (https://arxiv.org/html/2607.20495#bib.bib13), 24 (https://arxiv.org/html/2607.20495#bib.bib15)]。这些系统针对的是具有静态、以数据为中心的DAG的批处理工作负载。 ##### 具有DAG计划的多智能体系统。 智能体系统采用DAG来结构化任务执行,其中节点代表智能体动作(LLM调用、工具调用、计算),边编码执行依赖关系。近期工作展示了智能体如何通过基于DAG的任务图进行特定主题推理和去中心化架构协调[5 (https://arxiv.org/html/2607.20495#bib.bib17), 32 (https://arxiv.org/html/2607.20495#bib.bib16)],同时基准测试刻画了多智能体工作流中常见的DAG模式[21 (https://arxiv.org/html/2607.20495#bib.bib18)]。 ### II-C 多智能体系统编排与优化 除了缓存之外,还有研究探索通过编排、调度和工作流设计来提高多智能体效率的互补方法。 ##### 调度与编排。 存在多个系统通过工作流感知的资源管理来优化智能体执行。Kairos[2 (https://arxiv.org/html/2607.20495#bib.bib19)]引入了考虑智能体执行特性和内存约束的优先级调度。另一个例子是Ayo[25 (https://arxiv.org/html/2607.20495#bib.bib20)],它提出了细粒度的数据流编排,可以实现跨模块优化。这些方法通过优化执行顺序和资源分配来提高效率,并且通常与缓存正交。 ##### 工作流生成与自动化。 近期工作也探索了自动化工作流构建。AFlow[38 (https://arxiv.org/html/2607.20495#bib.bib21)]和ADAS[8 (https://arxiv.org/html/2607.20495#bib.bib22)]通过搜索和学习工作流架构,来学习有效的协作模式和智能体。DynaSaur[18 (https://arxiv.org/html/2607.20495#bib.bib24)]支持动态动作组合,使智能体能够基于中间结果自适应地修改工作流。这些编排和优化技术解决的问题与缓存正交。调关注执行顺序,工作流生成改进任务分解,而缓存消除冗余计算。这些技术可以结合使用。更好的调度可能会改善缓存局部性,而有效的缓存可以减少计算负载。 ## III 设计 多智能体工作流将复杂任务分解为一系列专业操作,例如检索、推理、综合等。这些操作可以形成有向无环图(DAG),其中每个节点代表一个智能体执行,边编码任务之间的依赖关系。缓存此DAG中代价高昂的操作(如LLM推理、视觉编码和OCR)可以通过避免跨查询的冗余计算,显著减少延迟。然而,现有的淘汰策略缺少多智能体工作负载中独有的三个信号:DAG拓扑(揭示哪些缓存结果馈送至下游任务)、执行成本(在智能体类型之间可能相差数个数量级),以及智能体调用频率(也能反映缓存结果被重用的可能性)。我们提出了一种工作负载感知的淘汰策略,将这三个信号结合成一个统一的评分函数,以在内存约束下最大化多智能体系统的缓存效用。
相似文章
面向低延迟多智能体工具调用的有状态推理架构
本文提出了一种用于多智能体工具调用的有状态推理架构,该架构在多次调用之间复用KV缓存,并采用推测解码技术,相较于vLLM和SGLang,在智能体工作流上实现了2.1倍至4.2倍的加速。
ReCache:面向工具增强LLM代理的高效KV缓存重用与压缩
ReCache是一个用于工具增强LLM代理中高效KV缓存重用与压缩的框架,在保持性能的同时实现显著的加速和内存减少。
Practical Online KV Cache Compaction for LLM Agents: An Empirical Study
This empirical study examines practical online KV cache compaction for LLM agents, comparing token eviction and attention matching methods under different proxy query sources. It finds that delaying compaction to use future agent queries recovers performance, and token eviction preserves accuracy while reducing KV cache by 80%.
代理服务中基于学习智能体执行的KV-Cache管理
CacheScout是一个用于多智能体LLM服务的智能体感知KV-Cache运行时层,它在线学习智能体执行语义,以指导缓存淘汰和预取,从而提高缓存命中率并降低延迟。
如何管理代理记忆而不让其变成杂物抽屉?
关于管理AI系统中代理记忆的实际挑战的讨论,侧重于避免信息过载导致输出质量下降,并提出使用工作流状态和多代理架构等策略。