@dair_ai:微软新论文:在测试时压缩智能体上下文。如果你的智能体随着交互历史变多而性能下降……
摘要
Microsoft 的 M365 Research 提出了 FOCUS,这是一种无需训练的测试时方法,通过仅保留对未来决策产生因果影响的单元来压缩 LLM 智能体的交互历史,最多可将峰值上下文降低 48%,并将任务成功率相比全历史执行提升最多 8.9 个百分点。
查看缓存全文
缓存时间: 2026/10/02 16:43
微软最新论文:在测试时压缩 Agent 的上下文
如果你的 Agent 随着交互历史变长而表现变差,这篇论文的方法值得一试。
FOCUS 会判断 Agent 的下一步决策究竟依赖于哪些过去的交互,并保留这些历史单元、丢弃其余部分。它不需要训练数据或微调,因此可以作为独立的一层,接入闭源 API 模型前方。
在工具调用、问答、网页以及多轮对话基准测试中,与使用完整历史相比,它最多可将峰值上下文削减 48%,并使任务成功率最多提升 8.9 个百分点。
论文:https://academy.dair.ai/papers/focus-training-free-decision-preserving-context-compression-for-llm-agents-2609.37590…
FOCUS:面向 LLM Agent 的免训练、决策保持式上下文压缩
来源:https://academy.dair.ai/papers/focus-training-free-decision-preserving-context-compression-for-llm-agents-2609.37590 效率 · Agent | 与论文对话(https://academy.dair.ai/dashboard/paper-chat/focus-training-free-decision-preserving-context-compression-for-llm-agents-2609.37590)
首页
FOCUS:面向 LLM Agent 的免训练、决策保持式上下文压缩
策展人点评
来自 Microsoft M365 Research 的 Shantanu Dixit、Xuchao Zhang、Chetan Bansal、Saravan Rajmohan 等人提出了 FOCUS:一种免训练的测试时方法,通过保留那些在因果上决定 Agent 下一步决策的交互单元来压缩历史。
向这篇论文提问
关于这篇论文的问题
核心要点 01
重新定义目标。现有方法(对比式指导、蒸馏式压缩器、训练过的压缩策略)都是离线学习“该丢弃什么“;而 FOCUS 则追问 Agent 的未来决策依赖哪些过去交互,并把压缩视为在离散交互单元上保持这些决策。
02
无需训练。它不需要离线数据或微调,可以作为一个独立的压缩层接入闭源 API 的前沿模型。
03
实验结果。在 API 与工具调用、问答、网页以及多轮对话等各类基准测试上,与不压缩的执行方式相比,峰值上下文最多削减 48%、依赖量减少 73%,任务成功率最多提升 8.9 个百分点。
摘要 LLM Agent 会不断积累随任务长度线性增长的交互历史,导致推理成本呈二次方增长,并因注意力稀释而出现性能退化。现有的上下文压缩方法都以离线方式学习“该丢弃什么“:通过对比优化指导规则、蒸馏压缩器,或训练压缩策略。这带来了巨大的成本。此外,压缩策略是先验学习得到的,并未根据测试时不断演变的轨迹进行动态调整。在本文中,我们提出了一个互补的问题:哪些过去的交互在因果上决定了 Agent 的未来决策?我们将上下文压缩重新表述为一个针对离散交互单元的因果决策保持问题,并提出了 FOCUS——一个完全在测试时运行的免训练上下文压缩框架。我们的方法不需要离线数据收集或微调,且与架构无关,可作为模块化的压缩层接入任何闭源 API 的前沿模型。我们在包括 API 与工具调用、问答、网页领域和多轮对话在内的多种 Agent 基准测试上评估了 FOCUS。我们的方法取得了新的 SOTA 性能:与不压缩执行相比,峰值上下文最多削减 48%、依赖量减少 73%,任务成功率最多提升 8.9 个百分点。
相似文章
Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability
This empirical study investigates how recurrent context compression affects long-horizon agent behavior, showing that compression can weaken recent interaction influence and cause instability. The authors introduce TRACE, a verifier-guided framework that improves compression reliability and performance on AppWorld.
上下文压缩应该保留什么?我观察了六种智能体的处理方式[D]
分析六种AI编程智能体(Claude Code、Codex CLI、OpenCode、Cline、Cursor、Amp)如何趋同于分层渐进式压缩以处理长上下文,它们在保护内容(用户消息、有状态工具输出)以及是否告知模型压缩方面存在差异,并在成本与准确性之间进行权衡。
@FinanceYF5: 已经是2026年了,为什么Agents的上下文压缩还在依赖摘要提示?Jev找到了一种更直接的方法……
Jev为AI Agents引入了实时压缩技术,它对每个工具调用进行评分,以保留重要内容并直接删除无关数据,消除了基于模型的摘要需求,使上下文压缩更快、更轻量。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2062553418460479577
一款名为Headroom的开源工具采用可逆的Compress-Cache-Retrieve架构,能将AI智能体上下文压缩高达90%,使模型能够在需要时检索原始细节,而非永久丢弃。
更少上下文,更智能代理:面向长周期工具使用的LLM代理的高效上下文工程
本文评估了企业工具使用工作流中LLM代理的上下文工程配置,表明选择性修剪的摘要化相比全上下文基线实现了91.6%的准确率,同时将令牌使用量减少了60%以上。