我测量了13个搜索API在智能体内运行的实际成本。定价页只是账单中较小的一半

Reddit r/AI_Agents 新闻

摘要

一位开发者在AI智能体内对13种搜索API配置进行了基准测试,发现读取负载的隐藏token成本可能占据总账单的大部分,而且不同提供商之间的差异高达67倍。

注意:我是下面13个提供商之一的开发者。所有负载、评分和价格都是公开的,你可以自己重新运行整个过程。每个搜索API都有且只有一个价格,即每次请求的价格。然后它会把你智能体需要的负载交给它,而你的模型会再次向你收费来读取这些负载。这第二项成本永远不会出现在定价页上,而且对大多数提供商来说,它才是更大的部分。因此,我在同样的100个问题上运行了13种定价配置。每次调用一个搜索接口,使用相同的阅读模型,负载原样传递(仅去掉各供应商自己的合成内容)。Token 数量来自回答调用的真实账单,而不是估算。价格对所有人都按列表价按量付费,包括我自己的在内。 | 提供商 | Token/查询 | 总计 $/1k | 正确率 | |---|---|---|---| | serpdive-krill | 971 | $2.91 | 78% | | serpdive-mako | 1,891 | $12.67 | 88% | | parallel-turbo | 4,155 | $13.46 | 79% | | tavily-basic | 3,166 | $17.50 | 88% | | parallel-advanced | 6,146 | $23.44 | 87% | | you-web | 9,026 | $32.08 | 95% | | parallel-basic | 13,015 | $44.05 | 83% | | linkup-standard | 16,150 | $53.45 | 85% | | tavily-advanced | 12,749 | $54.25 | 91% | | firecrawl-search | 16,458 | $55.77 | 94% | | serpdive-moby | 23,331 | $80.49 | 92% | | brave-search | 47,996 | $148.99 | 93% | | exa-search | 65,543 | $196.63 | 93% | 总计是请求加上读取 token 的费用,按 Sonnet 5 每百万 token $3 计算。token 列的最高与最低相差 67 倍。在你得结论之前,有两件事值得知道。答案键不能是一个固定文件。这些问题的答案是会变化的,而我采样的公共数据集最后一次重新发布于4月。到了8月,其中100个答案里有13个已经变了:每个引擎都返回了当前的事实,而基准测试把它们判为失败。按照这个过期的键评分,每个提供商都会损失8到18个百分点,而且数据最新的损失最多。所以键是在运行当天由实际数据本身重建的,每个提供商一票。另外,读最后一列时要考虑误差:在 n=100 时,它大约有正负10个百分点的波动,因此这次运行并不能区分出前几名。成本列没有这种噪声。包含每个负载、评分和价格的仓库在评论中。
查看原文

相似文章