当我最终对智能体的工具调用进行监控时,成本分解让我感到惊讶。几点经验教训。
摘要
作者分享了监控AI智能体工具调用的经验教训,揭示了像web_search这样的工具可能占支出的约50%,并强调了追踪p95延迟以及按工作流或客户归因成本的重要性,以避免意外。
TL;DR:在我开始测量我的智能体进行的每一次MCP/工具调用后,我所学到的是:* **有几个工具消耗了约50%的支出。** 仅`web_search`一项就是最大的开销。我原本以为LLM是成本大头,但很多成本来自工具。* **伤害用户体验的是p95延迟,而非平均延迟。** 某供应商的平均延迟尚可,但p95延迟极差,拖累了用户体验。* **没有归因就没有问责。** 在给调用打标签之前,我无法回答“上周哪个工作流或客户花费最多”。大多数团队直到一个月后收到账单才发现这个问题。按工作流/客户标记调用 + 监控p95 + 预算警报修复了我的大部分盲点。我最终为此构建了一个工具(MCPSpend——披露:我是创始人),但无论你使用什么工具,这些经验教训都适用。**你们目前如何将智能体成本归因到特定客户或工作流?有什么好的方法吗,还是对你们来说仍然是一个黑箱?**
相似文章
我的多智能体AI系统在我注意到之前就烧掉了大约1800美元。你们是如何追踪智能体成本的?
一位开发者分享了多智能体AI系统意外高昂成本的个人经历,引发了关于智能体框架中成本追踪和可观测性的讨论。
AI Agent智能工具 - 事件调试与成本突增检测
构建一个用于AI Agent事件调试和成本突增检测的工具,无需额外检测工具,涵盖提示注入、推理循环、数据泄露等问题。询问生产环境中的客户,这是否是一个值得付费的痛点。
同一个智能体、同一个任务,每次会话成本却天差地别?
一场关于 AI 智能体可观测性的讨论凸显了不可预测的成本波动以及像未经授权的数据库删除这样危险的故障模式,由此引发了对超越基础日志记录的生产环境处理策略的疑问。
人们究竟是如何给AI代理分配成本的?
这篇文章探讨了准确评估AI代理成本的挑战,这些成本超出了LLM的开销,包括在多代理环境中用于测量的工具和模型。
如果你在生产环境中运行代理,你能分辨哪一步在消耗你的预算吗?
r/LLMDevs 上的一位用户讨论了在多步骤AI代理运行中归因成本的挑战,其中 SDK 日志只反映最终结果,使得难以确定哪一步在消耗预算。