@pallavishekhar_: 如何减少AI代理中的Token使用?我们来理解一下。AI代理使用LLM进行思考、规划和推荐工具。每一步…

X AI KOLs Timeline 新闻

摘要

本帖子分享了减少AI代理中Token使用的策略,包括提示缓存、上下文摘要、使用较小模型、修剪工具输出、子代理、RAG以及紧凑的系统提示。

如何减少AI代理中的Token使用?我们来理解一下。 AI代理使用LLM进行思考、规划和推荐工具。每一步都会发送Token并接收Token。 因此,我们必须尽可能减少Token的使用。 第一个方法是提示缓存。大多数代理调用会重复相同的系统提示和工具定义。我们只缓存一次这个静态部分。模型会重用缓存的Token,而不是在每次调用时重新处理它们。 接下来是上下文摘要。随着对话的进行,历史记录会变得冗长。我们将较旧的消息压缩成简短摘要。代理保留最近的完整消息,而较旧的上下文则使用摘要。这样,我们就不必永远携带完整的历史记录。 现在,为简单任务使用较小模型。并非每一步都需要最大的模型。对于分类、路由或简单摘要,较小的模型就足够了。我们只在复杂推理时使用大模型。 我们还必须修剪工具结果。工具常常返回巨大的输出——长JSON、长网页、大文件。在将结果传回模型之前,我们要进行修剪。只保留对下一步有用的内容。 子代理很有帮助。无需将所有内容塞进一个上下文中,我们可以为子任务创建子代理。每个子代理在自己的上下文中运行。只有最终结果返回给主代理。这样主上下文保持整洁。 对于知识访问,使用RAG。不再粘贴完整文档,而是只获取相关片段。我们传递小而精确的上下文,而不是整个知识库。 最后,保持系统提示紧凑。每一个多余的词都会在每一次调用中消耗成本。这在数千次调用中累积起来。 这就是我们如何减少AI代理中的Token使用的方法。
查看原文
查看缓存全文

缓存时间: 2026/05/22 13:55

如何减少AI Agent中的token使用?我们来理解一下。

AI Agent 使用 LLM 进行思考、规划和推荐工具。每一步都会消耗输入 token 并产出输出 token。

因此,我们必须尽可能减少 token 的使用。

首先是Prompt Caching(提示缓存)。大多数 Agent 调用会重复相同的系统提示和工具定义。我们将这个静态部分缓存一次。模型重复使用缓存的 token,而不是在每次调用时重新处理。

接下来是Context Summarization(上下文摘要)。随着对话增长,历史记录变得很长。我们将较旧的消息压缩成简短摘要。Agent 保留最近的完整消息,而较旧的上下文则使用摘要。这样,我们就不必永远携带完整的历史记录。

现在,对于简单任务使用更小的模型。并非每一步都需要最大的模型。对于分类、路由或简单的摘要任务,一个较小的模型就足够了。我们只在复杂推理时使用大模型。

我们还必须修剪工具返回的结果。工具通常返回巨大的输出——长 JSON、长网页、大文件。我们在将结果传回模型之前进行修剪。只保留对下一步有用的内容。

子代理(Subagents) 帮助很大。不必将所有内容塞进一个上下文中,我们可以为子任务创建子代理。每个子代理在自己的上下文中运行。只有最终结果返回给主代理。主上下文保持干净。

对于知识访问,使用RAG(检索增强生成)。它不会粘贴完整文档,而是仅获取相关片段。我们传递小而精准的上下文,而不是整个知识库。

最后,保持系统提示简洁。每一个额外的词都会在每次调用中增加成本。这在数千次调用中累积起来。

这就是我们如何在 AI Agent 中减少 token 使用的方法。

相似文章