多智能体AI工作流中的Token优化与上下文窗口管理

arXiv cs.CL 论文

摘要

本文探讨了多智能体AI工作流中用于提高效率和性能的Token优化和上下文窗口管理技术。

arXiv:2608.17188v1 公告类型:新 摘要:多智能体AI工作流不仅受限于模型质量,还受限于token成本、延迟和上下文窗口质量。本文提出了一个针对token优化和上下文窗口管理的实践框架,该框架基于一个内部生产仪表板,该仪表板从会议、电子邮件和与LLMs的聊天中提取结构化工作项,并在工作流中路由摘要。描述了六种模式:上下文分层、一次获取/本地处理架构、模式约束提示、token感知回退链、语义缓存和代理间通信压缩。在生产环境中,它们将测量到的冷加载延迟从大约3.5-10.5分钟的运营基线降低到61-116秒(六次计时运行),并估计token减少了60-70%。它还报告了一个受控的上下文组合研究:在11种模型配置中进行了2,420次确认性试验,使用661个匿名化的工作场所项目进行相关性评分。将提示固定为十个项目,用同领域的低相关性项目替换一些高相关性项目,与仅使用高相关性项目相比,提高了模型对目标项目的相关性得分一致性;我们称之为相关性对比上下文。在全部11项配对分析中,50:50信号/噪声条件相比100%条件提高了+0.077的相关性准确性(朴素95% CI [+0.056, +0.098], Cohen's d = 0.49, Holm-adjusted p < .001, n = 220)。这些单元不是独立的;按九个模型家族计算,效应为+0.084(95%区间[+0.064, +0.103]),报告为语料库内的描述性比较,而非总体推断。一个Fusion-of-N后续研究发现,学习到的合成没有超过项目ID的机械集合并集。贡献在于模型研究与生产代理实践之间的一个可测量工程层:用于更快、更便宜、更可靠工作流的可重复模式和评估方法。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:52

# 多智能体AI工作流中的令牌优化与上下文窗口管理
来源:https://arxiv.org/abs/2608.17188
文献工具

## 文献与引用工具

文献探索器切换

代码、数据、媒体

## 本文相关代码、数据与媒体

演示

## 演示

相关论文

## 推荐器与搜索工具

关于arXivLabs

## arXivLabs:与社区合作者共同开展的实验项目

arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。

与arXivLabs合作的个人和组织都认同并接受了我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,只与遵守这些价值观的合作伙伴合作。

有能为arXiv社区创造价值的项目想法吗?**了解更多关于arXivLabs的信息**(https://info.arxiv.org/labs/index.html)。

相似文章