子代理在长代理运行中占据大部分Token成本:实际可将使用量降低70%至90%的修复方法

Reddit r/artificial 论文

摘要

本文分析了 Bai 等人 2026 年的论文,该论文表明,子代理和上下文膨胀导致长代理运行中的Token成本比普通聊天高出约1000倍,并提出了三种实用的修复方法(PLAN.md、读取预算、带外备注),可将Token使用量减少70-90%。

在运行多轮或多代理AI会话吗?所有工具都存在一致的退化模式:上下文充满重复的历史记录、工具模式和子代理交接。一篇 [Bai 等人 2026 年的论文](https://arxiv.org/abs/2604.22750) 研究了 SWE-bench 上八个前沿模型,发现代理编码任务消耗的Token数量大约是普通聊天的1000倍,同一任务上的差异可达30倍。准确性并不随投入增加而提高。在我跟踪的一次研究综合运行中,观察到的上下文达到了450,000个Token。代理忽略了早期约束,重新查询了历史中已有的来源,并需要手动重置。在添加了三个控制措施后,同一类任务的峰值Token数降至约85,000:* **PLAN.md 和 INVARIANTS.md** 放在对话窗口之外,每个主要轮次重新读取 * 每轮 **2,000行读取预算门控**(代理在检索前先声明意图) * **带外备注** 用于子代理协调,使得侧路流量永远不会进入主记录。动态工具发现产生了类似的比例。一个工具集通过仅加载代理实际选择的工具模式,而不是每次调用都注入完整目录,将输入Token减少了96%,总成本降低了90%。[包含论文分析、tree-sitter提取模式和实现检查清单的完整文章](https://jackmaguire.org/blog/subagents-account-for-most-token-costs-in-long-agent-runs/) 在你自己的代理会话中,你遇到过哪些Token或成本模式?
查看原文

相似文章

你们究竟是如何降低 Agent 系统成本的?

Reddit r/AI_Agents

本文探讨了 AI Agent 系统在成本优化和 FinOps 方面面临的挑战,指出了 Token 账单不可预测、缺乏细粒度归因工具等问题,并提到了缓存和硬性限制等应对策略。