当我最终对智能体的工具调用进行监控时,成本分解让我感到惊讶。几点经验教训。

Reddit r/AI_Agents 工具

摘要

作者分享了监控AI智能体工具调用的经验教训,揭示了像web_search这样的工具可能占支出的约50%,并强调了追踪p95延迟以及按工作流或客户归因成本的重要性,以避免意外。

TL;DR:在我开始测量我的智能体进行的每一次MCP/工具调用后,我所学到的是:* **有几个工具消耗了约50%的支出。** 仅`web_search`一项就是最大的开销。我原本以为LLM是成本大头,但很多成本来自工具。* **伤害用户体验的是p95延迟,而非平均延迟。** 某供应商的平均延迟尚可,但p95延迟极差,拖累了用户体验。* **没有归因就没有问责。** 在给调用打标签之前,我无法回答“上周哪个工作流或客户花费最多”。大多数团队直到一个月后收到账单才发现这个问题。按工作流/客户标记调用 + 监控p95 + 预算警报修复了我的大部分盲点。我最终为此构建了一个工具(MCPSpend——披露:我是创始人),但无论你使用什么工具,这些经验教训都适用。**你们目前如何将智能体成本归因到特定客户或工作流?有什么好的方法吗,还是对你们来说仍然是一个黑箱?**
查看原文

相似文章

AI Agent智能工具 - 事件调试与成本突增检测

Reddit r/AI_Agents

构建一个用于AI Agent事件调试和成本突增检测的工具,无需额外检测工具,涵盖提示注入、推理循环、数据泄露等问题。询问生产环境中的客户,这是否是一个值得付费的痛点。