子代理在长代理运行中占据大部分Token成本:实际可将使用量降低70%至90%的修复方法
摘要
本文分析了 Bai 等人 2026 年的论文,该论文表明,子代理和上下文膨胀导致长代理运行中的Token成本比普通聊天高出约1000倍,并提出了三种实用的修复方法(PLAN.md、读取预算、带外备注),可将Token使用量减少70-90%。
在运行多轮或多代理AI会话吗?所有工具都存在一致的退化模式:上下文充满重复的历史记录、工具模式和子代理交接。一篇 [Bai 等人 2026 年的论文](https://arxiv.org/abs/2604.22750) 研究了 SWE-bench 上八个前沿模型,发现代理编码任务消耗的Token数量大约是普通聊天的1000倍,同一任务上的差异可达30倍。准确性并不随投入增加而提高。在我跟踪的一次研究综合运行中,观察到的上下文达到了450,000个Token。代理忽略了早期约束,重新查询了历史中已有的来源,并需要手动重置。在添加了三个控制措施后,同一类任务的峰值Token数降至约85,000:* **PLAN.md 和 INVARIANTS.md** 放在对话窗口之外,每个主要轮次重新读取 * 每轮 **2,000行读取预算门控**(代理在检索前先声明意图) * **带外备注** 用于子代理协调,使得侧路流量永远不会进入主记录。动态工具发现产生了类似的比例。一个工具集通过仅加载代理实际选择的工具模式,而不是每次调用都注入完整目录,将输入Token减少了96%,总成本降低了90%。[包含论文分析、tree-sitter提取模式和实现检查清单的完整文章](https://jackmaguire.org/blog/subagents-account-for-most-token-costs-in-long-agent-runs/) 在你自己的代理会话中,你遇到过哪些Token或成本模式?
相似文章
你们究竟是如何降低 Agent 系统成本的?
本文探讨了 AI Agent 系统在成本优化和 FinOps 方面面临的挑战,指出了 Token 账单不可预测、缺乏细粒度归因工具等问题,并提到了缓存和硬性限制等应对策略。
如果你的智能体学到了任何东西,为什么 Run 10 的成本和 Run 1 一样?
对AI智能体token消耗的批判;提出Token投资回报率(ROTI)作为效率指标,指出大多数智能体不会随着时间减少token使用量。
@_avichawla: https://x.com/_avichawla/status/2063548691353629040
阐述了传统后端如何增加AI代理的token使用量,并展示了一种上下文工程方法,该方法无需更改模型或提示词即可将Claude Code会话成本降低2.5倍。
@pallavishekhar_: 如何减少AI代理中的Token使用?我们来理解一下。AI代理使用LLM进行思考、规划和推荐工具。每一步…
本帖子分享了减少AI代理中Token使用的策略,包括提示缓存、上下文摘要、使用较小模型、修剪工具输出、子代理、RAG以及紧凑的系统提示。
运行AI代理最昂贵的部分不是令牌消耗,而是花在弄清楚它们行为原因的时间。
构建AI代理的过程揭示,主要成本在于调试——花费数周追踪诸如上游API变更等问题——而不仅仅是令牌或模型推理成本。