@dair_ai:微软新论文:在测试时压缩智能体上下文。如果你的智能体随着交互历史变多而性能下降……

X AI KOLs Timeline 论文

摘要

Microsoft 的 M365 Research 提出了 FOCUS,这是一种无需训练的测试时方法,通过仅保留对未来决策产生因果影响的单元来压缩 LLM 智能体的交互历史,最多可将峰值上下文降低 48%,并将任务成功率相比全历史执行提升最多 8.9 个百分点。

微软发表了一篇关于在测试时压缩智能体上下文的新论文。 如果你的智能体随着交互历史的增长而表现变差,这个方法值得一试。 FOCUS 会追问:智能体的下一步决策究竟依赖于哪些历史交互?它保留这些历史单元,丢弃其余部分。该方法不需要训练数据,也不需要微调,因此可以作为独立的一层直接部署在封闭 API 的模型前面。 在工具调用、问答、网页浏览和多轮对话等基准测试上,与基于完整历史执行相比,它最多可将峰值上下文削减 48%,并使任务成功率提升最多 8.9 个百分点。 论文:https://academy.dair.ai/papers/focus-training-free-decision-preserving-context-compression-for-llm-agents-2609.37590…
查看原文
查看缓存全文

缓存时间: 2026/10/02 16:43

微软最新论文:在测试时压缩 Agent 的上下文

如果你的 Agent 随着交互历史变长而表现变差,这篇论文的方法值得一试。

FOCUS 会判断 Agent 的下一步决策究竟依赖于哪些过去的交互,并保留这些历史单元、丢弃其余部分。它不需要训练数据或微调,因此可以作为独立的一层,接入闭源 API 模型前方。

在工具调用、问答、网页以及多轮对话基准测试中,与使用完整历史相比,它最多可将峰值上下文削减 48%,并使任务成功率最多提升 8.9 个百分点。

论文:https://academy.dair.ai/papers/focus-training-free-decision-preserving-context-compression-for-llm-agents-2609.37590…


FOCUS:面向 LLM Agent 的免训练、决策保持式上下文压缩

来源:https://academy.dair.ai/papers/focus-training-free-decision-preserving-context-compression-for-llm-agents-2609.37590 效率 · Agent | 与论文对话(https://academy.dair.ai/dashboard/paper-chat/focus-training-free-decision-preserving-context-compression-for-llm-agents-2609.37590)

首页

FOCUS:面向 LLM Agent 的免训练、决策保持式上下文压缩

策展人点评

来自 Microsoft M365 Research 的 Shantanu Dixit、Xuchao Zhang、Chetan Bansal、Saravan Rajmohan 等人提出了 FOCUS:一种免训练的测试时方法,通过保留那些在因果上决定 Agent 下一步决策的交互单元来压缩历史。

向这篇论文提问

关于这篇论文的问题

核心要点 01

重新定义目标。现有方法(对比式指导、蒸馏式压缩器、训练过的压缩策略)都是离线学习“该丢弃什么“;而 FOCUS 则追问 Agent 的未来决策依赖哪些过去交互,并把压缩视为在离散交互单元上保持这些决策。

02

无需训练。它不需要离线数据或微调,可以作为一个独立的压缩层接入闭源 API 的前沿模型。

03

实验结果。在 API 与工具调用、问答、网页以及多轮对话等各类基准测试上,与不压缩的执行方式相比,峰值上下文最多削减 48%、依赖量减少 73%,任务成功率最多提升 8.9 个百分点。

摘要 LLM Agent 会不断积累随任务长度线性增长的交互历史,导致推理成本呈二次方增长,并因注意力稀释而出现性能退化。现有的上下文压缩方法都以离线方式学习“该丢弃什么“:通过对比优化指导规则、蒸馏压缩器,或训练压缩策略。这带来了巨大的成本。此外,压缩策略是先验学习得到的,并未根据测试时不断演变的轨迹进行动态调整。在本文中,我们提出了一个互补的问题:哪些过去的交互在因果上决定了 Agent 的未来决策?我们将上下文压缩重新表述为一个针对离散交互单元的因果决策保持问题,并提出了 FOCUS——一个完全在测试时运行的免训练上下文压缩框架。我们的方法不需要离线数据收集或微调,且与架构无关,可作为模块化的压缩层接入任何闭源 API 的前沿模型。我们在包括 API 与工具调用、问答、网页领域和多轮对话在内的多种 Agent 基准测试上评估了 FOCUS。我们的方法取得了新的 SOTA 性能:与不压缩执行相比,峰值上下文最多削减 48%、依赖量减少 73%,任务成功率最多提升 8.9 个百分点。

相似文章

上下文压缩应该保留什么?我观察了六种智能体的处理方式[D]

Reddit r/MachineLearning

分析六种AI编程智能体(Claude Code、Codex CLI、OpenCode、Cline、Cursor、Amp)如何趋同于分层渐进式压缩以处理长上下文,它们在保护内容(用户消息、有状态工具输出)以及是否告知模型压缩方面存在差异,并在成本与准确性之间进行权衡。