@dair_ai: 关于代理上下文修剪的精彩论文。这目前是个热门话题,所以可能值得你花时间。

X AI KOLs Timeline 论文

摘要

本文比较了AI代理的上下文修剪策略,发现采用协议感知修剪和自适应预算护栏可以在减少令牌的同时保持高任务成功率,尽管其实现有赖于黄金注释。

关于代理上下文修剪的精彩论文。 这目前是个热门话题,所以可能值得你花时间。 代理上下文修剪通常通过它移除多少令牌来评判。本研究还衡量了任务是否仍然成功。 这项工作在多步骤工具工作流上比较了五种修剪策略。近期性、相关性和摘要化节省了约60%的令牌,但任务成功率下降到66.6%至77.3%之间。 协议感知修剪保留标识符、约束、工具模式和未解决的承诺,并压缩其余部分。采用自适应预算护栏后,达到了96.0%的任务成功率和1.0%的级联失败率,同时仍节省了56.0%的令牌。 预算有很大影响。 保留25%或更少的上下文,与保留50%或更多相比,失败概率增加了10.92倍,并且复杂工作流需要更多保留的上下文。 有一个注意事项。受保护的状态来自黄金注释,因此生产系统仍需自行检测该状态。 论文链接:https://academy.dair.ai/papers/protocol-preserving-context-trimming-for-agentic-workflows-benefits-failure-regi-2609.16461…
查看原文
查看缓存全文

缓存时间: 2026/09/16 18:13

这篇论文探讨了智能体的上下文裁剪问题,目前是个热门话题,值得你花时间阅读。

智能体上下文裁剪的效果通常以移除的token数量来衡量,但本研究同时评估了任务是否仍能成功完成。

该工作在多步骤工具工作流中比较了五种裁剪策略。基于时间、相关性和摘要的裁剪虽然节省了约60%的token,但任务成功率下降至66.6%到77.3%。

协议感知裁剪保留标识符、约束条件、工具模式和未解决的承诺,仅压缩其余内容。配合自适应预算护栏,这种方法在仍节省56.0%token的前提下,实现了96.0%的任务成功率和1.0%的级联失败率。

预算设置影响显著:

保留25%或更少上下文的失败几率是保留50%或以上上下文的10.92倍,且复杂工作流需要保留更多上下文。

有一个注意事项:被保护的状态来自黄金标准标注,因此生产系统仍需自行检测这些状态。

论文链接:https://academy.dair.ai/papers/protocol-preserving-context-trimming-for-agentic-workflows-benefits-failure-regi-2609.16461…


智能体工作流的协议保护型上下文裁剪:效益、失败模式与预算护栏

来源:https://academy.dair.ai/papers/protocol-preserving-context-trimming-for-agentic-workflows-benefits-failure-regi-2609.16461 智能体 · 效率 · 安全与论文对话(https://academy.dair.ai/dashboard/paper-chat/protocol-preserving-context-trimming-for-agentic-workflows-benefits-failure-regi-2609.16461)

首页

智能体工作流的协议保护型上下文裁剪:效益、失败模式与预算护栏

编辑视角

Harish Gaggar(Intuit Credit Karma)比较了五种多步骤智能体工作流的上下文裁剪策略,发现保留协议关键状态比移除文本数量更重要。

关于本文的问答

问题 核心要点 01

策略对比:基于时间、相关性、摘要、协议感知裁剪和自适应预算护栏,评估指标包括任务成功率、协议遵从度、有效工具调用、token节省量、延迟和级联失败。

02

传统裁剪:约节省60%token,但任务成功率仅66.6%-77.3%,协议遵从度85.5%-88.6%。

03

协议感知与自适应方案:协议感知裁剪将任务成功率提升至92.2%;自适应护栏达到96.0%成功率、96.3%协议遵从度,级联失败率仅1.0%,同时仍节省56.0%token。

04

注意事项:协议感知条件保护的状态来自两个独立黄金标准标注,这证明了识别关键状态的重要性;论文未说明所用模型,数据可按需提供。

05

预算阈值:保留25%或更少上下文会使失败几率增加10.92倍(相对于保留50%以上),临界阈值随工作流复杂度增加而提升。

摘要:智能体大语言模型系统依赖长期交互历史来保存指令、工具状态、中间决策和未解决的依赖关系,但无限制的上下文增长会增加计算成本并可能降低效率。本研究将协议保护型上下文裁剪评估为多步骤智能体工作流的可靠性约束方法。通过任务成功率、协议遵从度、有效工具调用、token节省量、延迟降低、级联失败和关键上下文阈值等指标,在不同的保留上下文水平和工作流复杂度类别下,比较了五种裁剪策略——基于时间、相关性、摘要、协议感知裁剪和自适应预算护栏。传统策略实现约60%的平均token节省,但任务成功率较低(66.6%-77.3%),协议遵从度为85.5%-88.6%。协议感知裁剪将任务成功率提升至92.2%,而自适应护栏实现了96.0%的任务成功率、96.3%的协议遵从度,级联失败率仅1.0%,平均token节省56.0%。保留上下文预算为25%或更少时,失败几率相对于50%或以上的预算增加了10.92倍(p<0.001)。在激进预算下,协议感知裁剪的成功完成几率比传统方法高5.24倍,而自适应护栏相对于固定的协议感知裁剪进一步将成功几率提高了2.11倍(p<0.001)。关键上下文阈值也随工作流复杂度增加而上升。这些发现表明,可靠的上下文缩减更多地取决于保留协议关键状态,而非最大化token移除量,且自适应护栏能够提升长期智能体系统的效率、可扩展性和可靠性。

相似文章

@dair_ai: https://x.com/dair_ai/status/2066174390048358760

X AI KOLs Following

一个精选的推文串,涵盖了三篇引人注目的人工智能论文:用于高效长上下文推理的MiniMax Sparse Attention、用于自我改进智能体框架的Self-Harness,以及用于衡量智能体经济价值的Agents' Last Exam基准测试。