多智能体AI工作流中的Token优化与上下文窗口管理
摘要
本文探讨了多智能体AI工作流中用于提高效率和性能的Token优化和上下文窗口管理技术。
arXiv:2608.17188v1 公告类型:新
摘要:多智能体AI工作流不仅受限于模型质量,还受限于token成本、延迟和上下文窗口质量。本文提出了一个针对token优化和上下文窗口管理的实践框架,该框架基于一个内部生产仪表板,该仪表板从会议、电子邮件和与LLMs的聊天中提取结构化工作项,并在工作流中路由摘要。描述了六种模式:上下文分层、一次获取/本地处理架构、模式约束提示、token感知回退链、语义缓存和代理间通信压缩。在生产环境中,它们将测量到的冷加载延迟从大约3.5-10.5分钟的运营基线降低到61-116秒(六次计时运行),并估计token减少了60-70%。它还报告了一个受控的上下文组合研究:在11种模型配置中进行了2,420次确认性试验,使用661个匿名化的工作场所项目进行相关性评分。将提示固定为十个项目,用同领域的低相关性项目替换一些高相关性项目,与仅使用高相关性项目相比,提高了模型对目标项目的相关性得分一致性;我们称之为相关性对比上下文。在全部11项配对分析中,50:50信号/噪声条件相比100%条件提高了+0.077的相关性准确性(朴素95% CI [+0.056, +0.098], Cohen's d = 0.49, Holm-adjusted p < .001, n = 220)。这些单元不是独立的;按九个模型家族计算,效应为+0.084(95%区间[+0.064, +0.103]),报告为语料库内的描述性比较,而非总体推断。一个Fusion-of-N后续研究发现,学习到的合成没有超过项目ID的机械集合并集。贡献在于模型研究与生产代理实践之间的一个可测量工程层:用于更快、更便宜、更可靠工作流的可重复模式和评估方法。
查看缓存全文
缓存时间: 2026/08/19 09:52
# 多智能体AI工作流中的令牌优化与上下文窗口管理 来源:https://arxiv.org/abs/2608.17188 文献工具 ## 文献与引用工具 文献探索器切换 代码、数据、媒体 ## 本文相关代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐器与搜索工具 关于arXivLabs ## arXivLabs:与社区合作者共同开展的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。 与arXivLabs合作的个人和组织都认同并接受了我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,只与遵守这些价值观的合作伙伴合作。 有能为arXiv社区创造价值的项目想法吗?**了解更多关于arXivLabs的信息**(https://info.arxiv.org/labs/index.html)。
相似文章
我为代码智能体构建了一个上下文窗口优化框架——开源 + 论文
作者介绍了“Apohara Context Forge”,这是一个开源框架及方法论,旨在通过角色感知分割和分层相关性评分来优化代码智能体的上下文窗口。
@sairahul1: https://x.com/sairahul1/status/2067171101978071501
本帖子全面介绍了AI代理的上下文工程技术,阐述了上下文管理对代理性能的关键作用,以及如何优化Token使用以避免性能退化。
人们如何在AI代理工作流中减少token浪费?
讨论了AI代理工作流中由于重复上下文导致的token浪费问题,介绍了一个名为Badgr-auto的开源代理用于去重,并询问社区如何应对该问题。
你在生产环境中如何对多个AI智能体处理Token预算?
关于在生产环境中部署多个AI智能体时管理Token预算策略的讨论,涵盖成本与效率考虑。
精选11个Token优化工具整合到一个安装程序中——我还漏掉了什么?
一位开发者分享了一个精心整理的安装程序,其中打包了11个Token优化工具,帮助AI代理管理上下文并减少Token使用量,同时向社区征求额外建议,特别是针对多代理设置。