@dair_ai: 关于代理上下文修剪的精彩论文。这目前是个热门话题,所以可能值得你花时间。
摘要
本文比较了AI代理的上下文修剪策略,发现采用协议感知修剪和自适应预算护栏可以在减少令牌的同时保持高任务成功率,尽管其实现有赖于黄金注释。
查看缓存全文
缓存时间: 2026/09/16 18:13
这篇论文探讨了智能体的上下文裁剪问题,目前是个热门话题,值得你花时间阅读。
智能体上下文裁剪的效果通常以移除的token数量来衡量,但本研究同时评估了任务是否仍能成功完成。
该工作在多步骤工具工作流中比较了五种裁剪策略。基于时间、相关性和摘要的裁剪虽然节省了约60%的token,但任务成功率下降至66.6%到77.3%。
协议感知裁剪保留标识符、约束条件、工具模式和未解决的承诺,仅压缩其余内容。配合自适应预算护栏,这种方法在仍节省56.0%token的前提下,实现了96.0%的任务成功率和1.0%的级联失败率。
预算设置影响显著:
保留25%或更少上下文的失败几率是保留50%或以上上下文的10.92倍,且复杂工作流需要保留更多上下文。
有一个注意事项:被保护的状态来自黄金标准标注,因此生产系统仍需自行检测这些状态。
论文链接:https://academy.dair.ai/papers/protocol-preserving-context-trimming-for-agentic-workflows-benefits-failure-regi-2609.16461…
智能体工作流的协议保护型上下文裁剪:效益、失败模式与预算护栏
来源:https://academy.dair.ai/papers/protocol-preserving-context-trimming-for-agentic-workflows-benefits-failure-regi-2609.16461 智能体 · 效率 · 安全与论文对话(https://academy.dair.ai/dashboard/paper-chat/protocol-preserving-context-trimming-for-agentic-workflows-benefits-failure-regi-2609.16461)
首页
智能体工作流的协议保护型上下文裁剪:效益、失败模式与预算护栏
编辑视角
Harish Gaggar(Intuit Credit Karma)比较了五种多步骤智能体工作流的上下文裁剪策略,发现保留协议关键状态比移除文本数量更重要。
关于本文的问答
问题 核心要点 01
策略对比:基于时间、相关性、摘要、协议感知裁剪和自适应预算护栏,评估指标包括任务成功率、协议遵从度、有效工具调用、token节省量、延迟和级联失败。
02
传统裁剪:约节省60%token,但任务成功率仅66.6%-77.3%,协议遵从度85.5%-88.6%。
03
协议感知与自适应方案:协议感知裁剪将任务成功率提升至92.2%;自适应护栏达到96.0%成功率、96.3%协议遵从度,级联失败率仅1.0%,同时仍节省56.0%token。
04
注意事项:协议感知条件保护的状态来自两个独立黄金标准标注,这证明了识别关键状态的重要性;论文未说明所用模型,数据可按需提供。
05
预算阈值:保留25%或更少上下文会使失败几率增加10.92倍(相对于保留50%以上),临界阈值随工作流复杂度增加而提升。
摘要:智能体大语言模型系统依赖长期交互历史来保存指令、工具状态、中间决策和未解决的依赖关系,但无限制的上下文增长会增加计算成本并可能降低效率。本研究将协议保护型上下文裁剪评估为多步骤智能体工作流的可靠性约束方法。通过任务成功率、协议遵从度、有效工具调用、token节省量、延迟降低、级联失败和关键上下文阈值等指标,在不同的保留上下文水平和工作流复杂度类别下,比较了五种裁剪策略——基于时间、相关性、摘要、协议感知裁剪和自适应预算护栏。传统策略实现约60%的平均token节省,但任务成功率较低(66.6%-77.3%),协议遵从度为85.5%-88.6%。协议感知裁剪将任务成功率提升至92.2%,而自适应护栏实现了96.0%的任务成功率、96.3%的协议遵从度,级联失败率仅1.0%,平均token节省56.0%。保留上下文预算为25%或更少时,失败几率相对于50%或以上的预算增加了10.92倍(p<0.001)。在激进预算下,协议感知裁剪的成功完成几率比传统方法高5.24倍,而自适应护栏相对于固定的协议感知裁剪进一步将成功几率提高了2.11倍(p<0.001)。关键上下文阈值也随工作流复杂度增加而上升。这些发现表明,可靠的上下文缩减更多地取决于保留协议关键状态,而非最大化token移除量,且自适应护栏能够提升长期智能体系统的效率、可扩展性和可靠性。
相似文章
@dair_ai: https://x.com/dair_ai/status/2066174390048358760
一个精选的推文串,涵盖了三篇引人注目的人工智能论文:用于高效长上下文推理的MiniMax Sparse Attention、用于自我改进智能体框架的Self-Harness,以及用于衡量智能体经济价值的Agents' Last Exam基准测试。
@sairahul1: https://x.com/sairahul1/status/2067171101978071501
本帖子全面介绍了AI代理的上下文工程技术,阐述了上下文管理对代理性能的关键作用,以及如何优化Token使用以避免性能退化。
多智能体AI工作流中的Token优化与上下文窗口管理
本文探讨了多智能体AI工作流中用于提高效率和性能的Token优化和上下文窗口管理技术。
更少上下文,更智能代理:面向长周期工具使用的LLM代理的高效上下文工程
本文评估了企业工具使用工作流中LLM代理的上下文工程配置,表明选择性修剪的摘要化相比全上下文基线实现了91.6%的准确率,同时将令牌使用量减少了60%以上。
@dair_ai: 如果你是一名 AI 开发者,这是一篇很棒的阅读材料。当前的上下文压缩器仅保留用户给出的 17% 的长期规则。会话约…
一篇新论文介绍了 COMPINT,一个评估套件,表明上下文压缩器会静默丢弃会话约束,平均仅保留 17%。一个简单的 SC 感知提取器无需修改压缩器或模型即可恢复超过 90% 的保留率。