我测量了13个搜索API在智能体内运行的实际成本。定价页只是账单中较小的一半
摘要
一位开发者在AI智能体内对13种搜索API配置进行了基准测试,发现读取负载的隐藏token成本可能占据总账单的大部分,而且不同提供商之间的差异高达67倍。
注意:我是下面13个提供商之一的开发者。所有负载、评分和价格都是公开的,你可以自己重新运行整个过程。每个搜索API都有且只有一个价格,即每次请求的价格。然后它会把你智能体需要的负载交给它,而你的模型会再次向你收费来读取这些负载。这第二项成本永远不会出现在定价页上,而且对大多数提供商来说,它才是更大的部分。因此,我在同样的100个问题上运行了13种定价配置。每次调用一个搜索接口,使用相同的阅读模型,负载原样传递(仅去掉各供应商自己的合成内容)。Token 数量来自回答调用的真实账单,而不是估算。价格对所有人都按列表价按量付费,包括我自己的在内。
| 提供商 | Token/查询 | 总计 $/1k | 正确率 |
|---|---|---|---|
| serpdive-krill | 971 | $2.91 | 78% |
| serpdive-mako | 1,891 | $12.67 | 88% |
| parallel-turbo | 4,155 | $13.46 | 79% |
| tavily-basic | 3,166 | $17.50 | 88% |
| parallel-advanced | 6,146 | $23.44 | 87% |
| you-web | 9,026 | $32.08 | 95% |
| parallel-basic | 13,015 | $44.05 | 83% |
| linkup-standard | 16,150 | $53.45 | 85% |
| tavily-advanced | 12,749 | $54.25 | 91% |
| firecrawl-search | 16,458 | $55.77 | 94% |
| serpdive-moby | 23,331 | $80.49 | 92% |
| brave-search | 47,996 | $148.99 | 93% |
| exa-search | 65,543 | $196.63 | 93% |
总计是请求加上读取 token 的费用,按 Sonnet 5 每百万 token $3 计算。token 列的最高与最低相差 67 倍。在你得结论之前,有两件事值得知道。答案键不能是一个固定文件。这些问题的答案是会变化的,而我采样的公共数据集最后一次重新发布于4月。到了8月,其中100个答案里有13个已经变了:每个引擎都返回了当前的事实,而基准测试把它们判为失败。按照这个过期的键评分,每个提供商都会损失8到18个百分点,而且数据最新的损失最多。所以键是在运行当天由实际数据本身重建的,每个提供商一票。另外,读最后一列时要考虑误差:在 n=100 时,它大约有正负10个百分点的波动,因此这次运行并不能区分出前几名。成本列没有这种噪声。包含每个负载、评分和价格的仓库在评论中。
相似文章
当我最终对智能体的工具调用进行监控时,成本分解让我感到惊讶。几点经验教训。
作者分享了监控AI智能体工具调用的经验教训,揭示了像web_search这样的工具可能占支出的约50%,并强调了追踪p95延迟以及按工作流或客户归因成本的重要性,以避免意外。
我问我的AI"CEO",代理订阅如何能够覆盖底层的API成本——这真的对吗?
关于AI代理订阅服务如何管理API成本的分析,揭示了池化、使用限制和自研模型所有权是关键因素,而许多转售商则薄利甚至亏损运营。
我的多智能体AI系统在我注意到之前就烧掉了大约1800美元。你们是如何追踪智能体成本的?
一位开发者分享了多智能体AI系统意外高昂成本的个人经历,引发了关于智能体框架中成本追踪和可观测性的讨论。
如果你为客户运行AI代理,你真的知道每个客户的实际成本吗?
一篇探讨企业为客户运行AI代理时是否真正了解每个客户成本的文章。
运行AI代理最昂贵的部分不是令牌消耗,而是花在弄清楚它们行为原因的时间。
构建AI代理的过程揭示,主要成本在于调试——花费数周追踪诸如上游API变更等问题——而不仅仅是令牌或模型推理成本。