@pallavishekhar_: 如何减少AI代理中的Token使用?我们来理解一下。AI代理使用LLM进行思考、规划和推荐工具。每一步…
摘要
本帖子分享了减少AI代理中Token使用的策略,包括提示缓存、上下文摘要、使用较小模型、修剪工具输出、子代理、RAG以及紧凑的系统提示。
查看缓存全文
缓存时间: 2026/05/22 13:55
如何减少AI Agent中的token使用?我们来理解一下。
AI Agent 使用 LLM 进行思考、规划和推荐工具。每一步都会消耗输入 token 并产出输出 token。
因此,我们必须尽可能减少 token 的使用。
首先是Prompt Caching(提示缓存)。大多数 Agent 调用会重复相同的系统提示和工具定义。我们将这个静态部分缓存一次。模型重复使用缓存的 token,而不是在每次调用时重新处理。
接下来是Context Summarization(上下文摘要)。随着对话增长,历史记录变得很长。我们将较旧的消息压缩成简短摘要。Agent 保留最近的完整消息,而较旧的上下文则使用摘要。这样,我们就不必永远携带完整的历史记录。
现在,对于简单任务使用更小的模型。并非每一步都需要最大的模型。对于分类、路由或简单的摘要任务,一个较小的模型就足够了。我们只在复杂推理时使用大模型。
我们还必须修剪工具返回的结果。工具通常返回巨大的输出——长 JSON、长网页、大文件。我们在将结果传回模型之前进行修剪。只保留对下一步有用的内容。
子代理(Subagents) 帮助很大。不必将所有内容塞进一个上下文中,我们可以为子任务创建子代理。每个子代理在自己的上下文中运行。只有最终结果返回给主代理。主上下文保持干净。
对于知识访问,使用RAG(检索增强生成)。它不会粘贴完整文档,而是仅获取相关片段。我们传递小而精准的上下文,而不是整个知识库。
最后,保持系统提示简洁。每一个额外的词都会在每次调用中增加成本。这在数千次调用中累积起来。
这就是我们如何在 AI Agent 中减少 token 使用的方法。
相似文章
@_avichawla: https://x.com/_avichawla/status/2063548691353629040
阐述了传统后端如何增加AI代理的token使用量,并展示了一种上下文工程方法,该方法无需更改模型或提示词即可将Claude Code会话成本降低2.5倍。
@sairahul1: https://x.com/sairahul1/status/2067171101978071501
本帖子全面介绍了AI代理的上下文工程技术,阐述了上下文管理对代理性能的关键作用,以及如何优化Token使用以避免性能退化。
人们如何在AI代理工作流中减少token浪费?
讨论了AI代理工作流中由于重复上下文导致的token浪费问题,介绍了一个名为Badgr-auto的开源代理用于去重,并询问社区如何应对该问题。
子代理在长代理运行中占据大部分Token成本:实际可将使用量降低70%至90%的修复方法
本文分析了 Bai 等人 2026 年的论文,该论文表明,子代理和上下文膨胀导致长代理运行中的Token成本比普通聊天高出约1000倍,并提出了三种实用的修复方法(PLAN.md、读取预算、带外备注),可将Token使用量减少70-90%。
一种全面方法,可大幅降低您的Agentic AI令牌成本至少95%,又名当前令牌缩减方法总结
本文提供了一份全面指南,旨在将Agentic AI系统的令牌成本降低95%,详细介绍了七种核心技术,包括树状文档架构、AI自动压缩、本地模型管理以及脚本到API调用。