当我最终对智能体的工具调用进行监控时,成本分解让我感到惊讶。几点经验教训。
摘要
作者分享了监控AI智能体工具调用的经验教训,揭示了像web_search这样的工具可能占支出的约50%,并强调了追踪p95延迟以及按工作流或客户归因成本的重要性,以避免意外。
TL;DR:在我开始测量我的智能体进行的每一次MCP/工具调用后,我所学到的是:* **有几个工具消耗了约50%的支出。** 仅`web_search`一项就是最大的开销。我原本以为LLM是成本大头,但很多成本来自工具。* **伤害用户体验的是p95延迟,而非平均延迟。** 某供应商的平均延迟尚可,但p95延迟极差,拖累了用户体验。* **没有归因就没有问责。** 在给调用打标签之前,我无法回答“上周哪个工作流或客户花费最多”。大多数团队直到一个月后收到账单才发现这个问题。按工作流/客户标记调用 + 监控p95 + 预算警报修复了我的大部分盲点。我最终为此构建了一个工具(MCPSpend——披露:我是创始人),但无论你使用什么工具,这些经验教训都适用。**你们目前如何将智能体成本归因到特定客户或工作流?有什么好的方法吗,还是对你们来说仍然是一个黑箱?**
相似文章
我的多智能体AI系统在我注意到之前就烧掉了大约1800美元。你们是如何追踪智能体成本的?
一位开发者分享了多智能体AI系统意外高昂成本的个人经历,引发了关于智能体框架中成本追踪和可观测性的讨论。
AI Agent智能工具 - 事件调试与成本突增检测
构建一个用于AI Agent事件调试和成本突增检测的工具,无需额外检测工具,涵盖提示注入、推理循环、数据泄露等问题。询问生产环境中的客户,这是否是一个值得付费的痛点。
同一个智能体、同一个任务,每次会话成本却天差地别?
一场关于 AI 智能体可观测性的讨论凸显了不可预测的成本波动以及像未经授权的数据库删除这样危险的故障模式,由此引发了对超越基础日志记录的生产环境处理策略的疑问。
运行AI代理最昂贵的部分不是令牌消耗,而是花在弄清楚它们行为原因的时间。
构建AI代理的过程揭示,主要成本在于调试——花费数周追踪诸如上游API变更等问题——而不仅仅是令牌或模型推理成本。
@IntuitMachine:你的AI编程代理仅修复一个bug就烧掉2美元。你以为这是“廉价自动化”。以下是16,000次生产运行揭示的真相…
对AI编程代理成本的分析显示,代理工作流消耗的token数可达简单ChatGPT调用的3500倍,大部分浪费来自冗余的上下文加载。文章建议追踪重复的文件操作并使用高效模型降低成本。