面向多智能体系统的工作负载感知缓存
摘要
本文提出了一种面向多智能体系统的工作负载感知缓存逐出策略,该策略利用重新计算成本、DAG依赖计数和智能体调用频率来保留有价值的缓存条目,相比于无缓存基线最多可将延迟降低64.7%,相比于次优的有限容量方法平均可降低31.1%。
arXiv:2607.20495v1 公告类型:新
摘要:多智能体系统将复杂任务分解为专门智能体执行的定向无环图(DAG),这为跨查询缓存中间结果创造了自然机会。然而,现有的缓存逐出策略基于访问历史统一对待所有缓存条目,忽略了智能体执行环境中独有的结构和工作负载信号。我们提出了一种工作负载感知逐出策略,将三种信号,即重新计算成本、DAG依赖计数和智能体调用频率,统一为一个评分函数,在内存约束下保留最有价值的条目。在涵盖不同重用场景的三个多智能体基准测试中,我们的策略相对于无缓存基线最多可将延迟降低64.7%,并且相比于次优的有限容量基线平均实现31.1%的延迟降低,同时接近无限缓存的性能,并保持与所有竞争有限容量方法相当或更优的准确率。我们进一步表明,工作负载感知内容缓存与其他智能体系统优化方法(包括计划级缓存和并行智能体执行)互补,每种技术针对多智能体管道中的不同效率瓶颈。
查看缓存全文
缓存时间: 2026/07/24 05:03
# 面向多智能体系统的工作负载感知缓存 来源:https://arxiv.org/html/2607.20495 ###### 摘要 多智能体系统将复杂任务分解为有向无环图(DAG)形式的专业智能体执行序列,这在跨查询执行过程中自然提供了缓存中间结果的机会。然而,现有的缓存淘汰策略基于访问历史对所有缓存条目一视同仁,忽略了智能体执行环境中独有的结构信号和工作负载信号。我们提出了一种工作负载感知的淘汰策略,该策略将重计算成本、DAG依赖计数和智能体调用频率三个信号结合成一个统一的评分函数,从而在内存约束下保留最有价值的条目。在三个覆盖不同重用模式的多智能体基准测试上,我们的策略相比无缓存基线将延迟降低了高达64.7%,相比次优的有限容量基线平均降低延迟31.1%,同时性能逼近无限缓存,并且准确率优于或等同于所有竞争的有限容量方法。我们进一步表明,工作负载感知的内容缓存与其他智能体系统优化方法(包括计划级缓存和并行智能体执行)是互补的,每种技术针对多智能体流水线中不同的效率瓶颈。 ## I 引言 AI系统正从单一模型架构转向复合系统,即使用并协调不同的专业智能体、工具和推理步骤来解答查询。多智能体系统已在软件工程、科学研究、自主决策等多个领域展现出能力[9 (https://arxiv.org/html/2607.20495#bib.bib29), 3 (https://arxiv.org/html/2607.20495#bib.bib37), 15 (https://arxiv.org/html/2607.20495#bib.bib44), 31 (https://arxiv.org/html/2607.20495#bib.bib35), 33 (https://arxiv.org/html/2607.20495#bib.bib30), 30 (https://arxiv.org/html/2607.20495#bib.bib38)]。然而,这种架构转变也带来了效率挑战,随着智能体交互因更复杂的计划而日益复杂,计算成本可能限制其在现实世界的实际部署。现代推理模型的推理成本,加上每个查询需要多次智能体调用,使得每一次冗余计算都代价高昂[14 (https://arxiv.org/html/2607.20495#bib.bib43)]——不仅体现在延迟上,也体现在资源利用上。 多智能体工作负载在不同查询之间可能存在大量的计算重叠。当不同查询共享共同的运算模式时,这种冗余就会出现。例如,在财务分析中,诸如“公司X的收入是多少?”和“公司X的利润率是多少?”之类的查询,都共享相同的初始步骤,如检索财务报表、解析文档和提取标准字段,仅在最终计算上有所不同。类似地,要求摘要与数据集描述的文档分析查询,可能共享相同的解析、章节识别和实体提取操作。这种模式不仅限于精确重复。结构相似的查询,如“分析2023年第一季度业绩”和“分析2023年第二季度业绩”,可能仅在日期过滤器上不同,但共享数据聚合、规范化和可视化逻辑。 许多现代多智能体系统使用基于DAG的计划,其中专业规划智能体将任务分解为结构化的执行计划(图1 (https://arxiv.org/html/2607.20495#S1.F1))。这些计划表示为有向无环图,其中节点对应计算任务(LLM调用、工具执行、数据处理),边编码这些任务之间的依赖关系。然后,执行器派发智能体完成任务,同时遵守依赖关系。这种将任务分解为可复用计算单元的做法,自然带来了缓存机会——如果我们缓存节点结果,当类似查询需要相同操作时,就可以复用它们。然而,无限缓存会迅速耗尽可用内存,这就需要制定淘汰策略来决定保留哪些缓存结果。 参见图注 图1:网络监控的多智能体工作流,表示为DAG。节点由专业智能体完成的步骤,边编码依赖关系。A) 遥测数据收集,B) 数据解析与标准化,C) 指标聚合与计算,D) 容量/使用情况分析,E) 异常检测,F) SLA策略评估,G) 仪表盘与告警更新。代价高昂的操作可从缓存中显著获益。 传统的淘汰策略,如最近最少使用(LRU)或最不经常使用(LFU),完全基于访问历史做出决策,使用时间或频率等指标,对所有缓存项一视同仁。这种方法虽有效,但忽略了多智能体规划系统中可用的几个结构信号和工作负载信号。例如,考虑一个容量已满的缓存,其中有两个节点。节点A在30秒前被访问,馈送给1个下游计算(因此它有一条出边),重计算需要0.3秒。节点B在5分钟前被访问,馈送给4个下游节点,并且由于昂贵的数据库查询和文档解析,重计算需要8秒。LRU根据较晚的访问时间淘汰节点B。当下一个查询到来,需要节点B的输出而非节点A时,系统必须重新计算(8秒)。如果淘汰节点A,代价仅为0.3秒。这只是统一对待未能识别节点B的结构重要性(馈送给多个依赖项)和高重计算成本使其更有保留价值的一个例子。除了结构考量,传统策略也没有利用工作负载模式。当用户探索相关问题(例如,分析同一公司的不同指标,或针对同一测试套件测试代码变体)时,基于查询相似性,某些DAG子图会暂时变得更有价值。一个了解这些语义模式的策略,可以优先保留可能在将来查询中被重用的节点。 本文介绍了一种专门为多智能体系统设计的工作负载感知、结构信息感知的缓存淘汰策略。我们的方法考虑了大多数传统策略忽略的三个维度。(1) 节点在DAG结构中的拓扑重要性,(2) 重计算被淘汰节点的计算成本,(3) 基于观察到的负载模式,未来重用的可能性。通过将这些信号结合成一个统一的评分函数,我们的策略相对于无缓存基线将延迟降低高达64.7%,同时在多样化的多智能体工作负载下性能逼近无限缓存。我们还分析了我们的方法如何与互补的多智能体效率技术交互,发现工作负载感知的内容缓存、计划级缓存和并行智能体执行是相互增强的。总体而言,我们的贡献如下: - C1 工作负载感知淘汰策略。一种针对多智能体系统的缓存淘汰策略,将重计算成本、DAG依赖计数和智能体调用频率结合成一个统一的评分函数,从而实现有原则的淘汰决策。 - C2 实证评估。在三个覆盖不同重用模式的多智能体基准测试上进行了全面评估,证明相对于标准淘汰基线,在延迟、吞吐量和准确性方面有一致的改进。 - C3 淘汰质量分析。一项分析表明,在异构智能体工作负载中,淘汰质量(而不仅仅是命中率)也是延迟收益的主要驱动因素,我们的策略持续淘汰比所有竞争方法更便宜的条目。 - C4 智能体优化研究。对工作负载感知缓存如何与互补技术(包括计划级缓存和并行智能体执行)交互的调查,揭示了协同效应。 ## II 背景与相关工作 我们将相关工作组织为三个领域:基于LLM的智能体的缓存技术、使用DAG的工作流抽象,以及高效的多智能体系统编排。 ### II-A LLM智能体中的缓存 随着基于LLM的智能体在复杂性和部署规模上的增长,缓存已成为不同抽象层次上的主要优化技术。我们按照缓存计算工件的粒度来组织这些方法。 ##### KV缓存 KV缓存指的是缓存来自Transformer注意力计算的键值张量[29 (https://arxiv.org/html/2607.20495#bib.bib41)]。vLLM[12 (https://arxiv.org/html/2607.20495#bib.bib5)]和SGLang[40 (https://arxiv.org/html/2607.20495#bib.bib6)]等现代服务系统引入了分页存储和基数树组织以实现高效的KV缓存管理,当GPU内存受限时通常采用基于LRU的淘汰策略。近期工作专门针对多智能体系统对此进行了扩展。KVFlow[20 (https://arxiv.org/html/2607.20495#bib.bib4)]引入了工作流感知的淘汰策略,使用智能体步骤图来预测执行顺序,为每个智能体分配一个“距执行步骤数”值,估计其距未来激活的时间接近度,并淘汰那些不太可能立即运行的智能体的缓存。KVCOMM[34 (https://arxiv.org/html/2607.20495#bib.bib7)]解决了一个互补的挑战,通过维护一个锚点池来存储在不同前缀下观察到的KV缓存偏移偏差,从而支持在不同前缀上下文的智能体之间共享KV缓存,实现缓存复用。 ##### 语义与工具级缓存 更高级别的系统基于查询相似性(而非精确匹配)来缓存LLM输出。GPTCache[1 (https://arxiv.org/html/2607.20495#bib.bib8)]开创了基于嵌入的语义缓存,用于LLM应用,使用相似性搜索[10 (https://arxiv.org/html/2607.20495#bib.bib40)]来复用语义相关查询的响应。在此基础上,Cortex[23 (https://arxiv.org/html/2607.20495#bib.bib9)]将语义缓存扩展到智能体工作负载中的工具输出,通过语义感知的知识缓存来解决跨区域数据访问延迟问题。这些方法(以及类似的方法)针对单个LLM或工具调用,在类似查询再次出现时减少冗余计算。 ##### 计划与推理级缓存 最高级别针对智能体执行的计划和推理阶段。智能体计划缓存[39 (https://arxiv.org/html/2607.20495#bib.bib10)]从完成的执行中提取结构化的计划模板,存储可泛化的工作流,这些工作流可以通过基于关键词的匹配和轻量级模板适配,适应具有类似任务意图的新查询。诸如SemanticALLI[4 (https://arxiv.org/html/2607.20495#bib.bib11)]中的方法对此进行了补充,通过在分析流水线中的多个检查点缓存中间推理表示,将结构化的推理状态视为一流的可缓存工件。这些方法在根本不同的粒度上运行。KV缓存方法优化推理延迟,语义缓存针对单个调用,而计划级系统减少规划开销。我们的工作引入了任务执行结果级别的缓存。 ### II-B 表示为DAG的工作流 有向无环图自然地表达了具有显式依赖关系的计算工作流,从而能够在多个领域进行依赖感知的优化。 ##### 数据分析系统。 DAG感知的缓存出现在批处理作业中,这些作业将自身分解为具有数据依赖关系的阶段。LRC[35 (https://arxiv.org/html/2607.20495#bib.bib12)]为Apache Spark[37 (https://arxiv.org/html/2607.20495#bib.bib39)]引入了基于引用计数的淘汰策略,优先保留拥有最多未计算子节点(这是一个比基于时间或频率的策略更好的未来效用指标)的缓存数据块。LERC[36 (https://arxiv.org/html/2607.20495#bib.bib14)]对此进行了扩展,引入了尊重“全有或全无”属性的协调淘汰策略,即只有当所有输入依赖项都保留在内存中时,任务才能从缓存中受益。类似的方法优化了物化视图和分布式查询执行[13 (https://arxiv.org/html/2607.20495#bib.bib13), 24 (https://arxiv.org/html/2607.20495#bib.bib15)]。这些系统针对的是具有静态、以数据为中心的DAG的批处理工作负载。 ##### 具有DAG计划的多智能体系统。 智能体系统采用DAG来结构化任务执行,其中节点代表智能体动作(LLM调用、工具调用、计算),边编码执行依赖关系。近期工作展示了智能体如何通过基于DAG的任务图进行特定主题推理和去中心化架构协调[5 (https://arxiv.org/html/2607.20495#bib.bib17), 32 (https://arxiv.org/html/2607.20495#bib.bib16)],同时基准测试刻画了多智能体工作流中常见的DAG模式[21 (https://arxiv.org/html/2607.20495#bib.bib18)]。 ### II-C 多智能体系统编排与优化 除了缓存之外,还有研究探索通过编排、调度和工作流设计来提高多智能体效率的互补方法。 ##### 调度与编排。 存在多个系统通过工作流感知的资源管理来优化智能体执行。Kairos[2 (https://arxiv.org/html/2607.20495#bib.bib19)]引入了考虑智能体执行特性和内存约束的优先级调度。另一个例子是Ayo[25 (https://arxiv.org/html/2607.20495#bib.bib20)],它提出了细粒度的数据流编排,可以实现跨模块优化。这些方法通过优化执行顺序和资源分配来提高效率,并且通常与缓存正交。 ##### 工作流生成与自动化。 近期工作也探索了自动化工作流构建。AFlow[38 (https://arxiv.org/html/2607.20495#bib.bib21)]和ADAS[8 (https://arxiv.org/html/2607.20495#bib.bib22)]通过搜索和学习工作流架构,来学习有效的协作模式和智能体。DynaSaur[18 (https://arxiv.org/html/2607.20495#bib.bib24)]支持动态动作组合,使智能体能够基于中间结果自适应地修改工作流。这些编排和优化技术解决的问题与缓存正交。调关注执行顺序,工作流生成改进任务分解,而缓存消除冗余计算。这些技术可以结合使用。更好的调度可能会改善缓存局部性,而有效的缓存可以减少计算负载。 ## III 设计 多智能体工作流将复杂任务分解为一系列专业操作,例如检索、推理、综合等。这些操作可以形成有向无环图(DAG),其中每个节点代表一个智能体执行,边编码任务之间的依赖关系。缓存此DAG中代价高昂的操作(如LLM推理、视觉编码和OCR)可以通过避免跨查询的冗余计算,显著减少延迟。然而,现有的淘汰策略缺少多智能体工作负载中独有的三个信号:DAG拓扑(揭示哪些缓存结果馈送至下游任务)、执行成本(在智能体类型之间可能相差数个数量级),以及智能体调用频率(也能反映缓存结果被重用的可能性)。我们提出了一种工作负载感知的淘汰策略,将这三个信号结合成一个统一的评分函数,以在内存约束下最大化多智能体系统的缓存效用。
相似文章
面向低延迟多智能体工具调用的有状态推理架构
本文提出了一种用于多智能体工具调用的有状态推理架构,该架构在多次调用之间复用KV缓存,并采用推测解码技术,相较于vLLM和SGLang,在智能体工作流上实现了2.1倍至4.2倍的加速。
如何管理代理记忆而不让其变成杂物抽屉?
关于管理AI系统中代理记忆的实际挑战的讨论,侧重于避免信息过载导致输出质量下降,并提出使用工作流状态和多代理架构等策略。
评估代理型计划-执行流水线中的时序语义缓存与工作流优化
本文介绍了针对代理型计划-执行流水线的时序语义缓存与MCP工作流优化,在缓存命中时实现了高达30.6倍的加速,并在AssetOpsBench工业基准测试上实现了1.67倍的整体加速。
您的智能体工作流的缓存保活成本高出8倍
一项跨Anthropic、OpenAI、Gemini和DeepSeek的详细测量研究发现,传统的30秒提示缓存保活频率过高8倍;4分钟间隔是最优的,并且只有在长时间空闲间隔下,Anthropic的缓存才能节省成本。
代理中的提示缓存
本文解释了提示缓存在大语言模型代理中的工作原理,涵盖 KV 缓存机制、预填充和解码阶段,以及其对延迟、成本和代理设计的影响。