AI Gateway 生产趋势(阅读时间8分钟)

TLDR AI 新闻

摘要

Vercel 的 AI Gateway 数据显示,Anthropic 在支出方面领先,Google 在 Token 量方面领先,而代理型工作负载占 Token 总量的 59%。OpenAI 的支出份额在最近的模型更新后增长了近两倍。

Vercel 分析了七个月中涵盖数百个模型和超过 20 万个团队的 AI Gateway 生产流量。报告显示,代理型工作负载快速增长,开源模型采用率不断提高,并且大规模部署中大量使用了多模型路由。
查看原文
查看缓存全文

缓存时间: 2026/05/15 00:12

# AI 网关生产指数 来源:https://vercel.com/blog/ai-gateway-production-index 问哪个 AI 模型最好,答案还没干透就变了。这就是一个每周都有新模型发布的行业现状。 每个基准测试衡量的都是不同的赛道,每条赛道都有自己的冠军,但 Vercel 通过生产工作负载获得了独特的行业视角。AI 网关(https://vercel.com/ai-gateway)通过真实应用和智能体,为数百个模型处理数万亿个 token。 **我们观察到的现象**: - Anthropic 虽然在单价上更高,但支出领先;Google 在用量上领先 - 开源模型正在获得关注,但用户对特定实验室没有忠诚度 - OpenAI 在近期模型更新后,支出份额增长迅速 - 高用量工作负载平均路由到 30 多个不同模型 - 智能体工作负载承载了 59% 的 token 量(6 个月内增长 2 倍) 本报告基于 AI 网关七个月的生产流量数据,来自超过 20 万个独立团队。 ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#anthropic-leads-in-spend;-google-leads-in-volume)Anthropic 支出领先;Google 用量领先 成本与用量排名出现分歧,因为它们衡量的是不同类型的工作负载,即使是同一个客户也是如此。 按 2026 年 4 月的支出计算,Anthropic 占 61%,Google 占 21%,OpenAI 占 12%。 按 token 用量来看,情况正好相反。4 月份通过 AI 网关的流量中,38% 路由到 Google,26% 到 Anthropic,13% 到 OpenAI,10% 到 xAI。较小的实验室瓜分了剩余部分。 有些模型的定位是靠足够低的每 token 价格来承载巨大用量,而另一些模型则定价较高,只适用于对质量要求苛刻的工作。不同模型并非在争夺同一个调用。总体来看,同一个客户群同时出现在两张榜单上,高价值的推理调用落在 Claude Opus(https://vercel.com/ai-gateway/models/claude-opus-4.7)上,而廉价快速的调用则落在 Gemini Flash(https://vercel.com/ai-gateway/models/gemini-3-flash)上。支出跟随高风险调用,用量跟随低风险调用,各个实验室各自占据同一应用的不同层级。 用量与支出的对比在实验室层面变化也很快。一些具体的信号: - Gemini Flash 帮助 Google 以较小的支出份额取得用量领先 - Claude Opus 帮助 Anthropic 以低于 Google 的用量实现支出领先 - 在 GPT-5.4/5.5(https://vercel.com/ai-gateway/models/gpt-5.5)发布后,OpenAI 的支出份额从 3 月到 4 月增长了三倍 - 随着 Gemini Flash 用量的扩大,Google 的支出份额从 3 月的 8% 上升到 4 月的 21% ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#spend-follows-the-cost-of-being-wrong)支出跟随错误的成本 同样的成本/用量差异也存在于特定工作负载类型的更细粒度中: - 个人助手占成本的 20%,占 token 用量的 40% - 编程智能体大致平衡,占成本的 22% 和 token 的 20% - 后台智能体占成本的 6% 和 token 的 15% - 应用生成占成本的 7% 和 token 的 11% 一个工作负载每 token 的花费取决于错误答案对该用例的代价。个人助手可以使用廉价快速的模型,因为错误只影响单个用户,而且很快就能纠正。后台工作流则愿意为更强的推理能力付费,因为错误可能引发法律、财务或运营风险,这远远超过每调用的节省。每 token 的经济学是一张风险地图:当错误成本更高时,应用会在每个 token 上花费更多。 同样的模式也体现在更广泛的 B2C/B2B 划分中。B2C 应用产生大量低成本调用,而 B2B 应用则运行较少但更昂贵的调用。按每 token 计算,B2B 的成本大约是 B2C 的两倍。 ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#no-single-provider-wins-across-use-cases)没有单一供应商能赢遍所有用例 按用例划分数据,呈现出碎片化的供应商格局: - Anthropic 在软件构建领域明显领先 - Google 在消费者领域占比偏高 - OpenAI 分布最均匀 - xAI 和其他供应商则分布在编程、消费者和长尾用例中 Anthropic 的模式是集中在高风险层。随着工作负载从后台转向消费者,Anthropic 的 token 份额从 71% 下降到 7%。其成本份额则遵循一条更平缓的曲线,并在四个类别中的三个保持领先。收入集中在答案必须正确的地方,无论通过多少用量。 Google 则是相反的形态。其足迹集中在消费者领域,在那里 Gemini Flash 承载了 28% 的 token,但只占成本的 15%,而在成本图表之外几乎看不到它的身影。这个位置是一个单一 SKU 的赌注,随着 Flash 的采用率而起伏。 xAI 是一个价格楔子。Grok(https://vercel.com/ai-gateway/models/grok-4.3)承载了 20% 的构建 token 和 18% 的外联 token,但在每个类别中的成本份额却小得多。xAI 凭借价格与质量的匹配取胜,而谁能匹配这个价格,谁就能填补这个楔子。 OpenAI 是四者中最平衡的:占构建成本的 6%,消费者成本的 18%,外联成本的 28%。没有任何一个单一层级对 OpenAI 的整体份额起决定性作用,这使得该公司在四个实验室中最不容易受到任何一个层级的中断影响。 像 Kimi(https://vercel.com/ai-gateway/models/kimi-k2.6)、MiniMax(https://vercel.com/ai-gateway/models/minimax-m2.7)和 GLM(https://vercel.com/ai-gateway/models/glm-5.1)这样的开放权重系列,在成本天花板最低的消费者和构建层级中轮换。它们的成本份额很小,但在消费者和构建层级内部的 token 份额却足够大,以至于任何仅关注成本的市场观点都会低估它们。 整个市场中没有单一的主导供应商,因为没有单一的主导用例。正确的问题不是“谁在 AI 领域获胜?”,而是“哪些模型在我关心的用例中获胜?”那些在混合图表上看起来最接近平均水平的实验室,实际上是在同一堆栈的不同层级上竞争。 ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#apps-are-becoming-more-agentic)应用正在变得更加智能体化 生产级 AI 请求的形态已经发生了变化。2026 年 4 月,AI 网关中 22.2% 的请求以工具调用结束,高于 2025 年 10 月的 11.4%。按 token 计算,变化更大。58.9% 的 token 现在来自工具调用请求,高于六个月前的 31.6%。 按这两种衡量标准,智能体的份额在半年内大约翻了一番,但更说明问题的是这两个份额之间的差距。22.2% 的请求承载了 58.9% 的 token,这意味着使用工具的请求的 token 消耗量大约是其他请求的 2.6 倍。AI 的成本面已经从聊天形态转向了智能体形态,而总的请求数量几乎没有变化。 每一种往返通信都按同一个计量器计费,无论是函数执行、API 调用、数据库查询还是代码运行,因此一个发送十个工具调用的智能体,其 token 费用大约是一个聊天的十倍。聊天每次提示只计一次往返,而智能体则计一条链。 ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#leaderboards-rank-one-model,-but-production-teams-use-35+-at-scale)排行榜只排一个模型,但生产团队在规模化时使用 35 个以上 在规模化层面,多模型不再是选择,而是标准的智能体架构。 运行 1K 到 10K 请求的团队平均使用 3 个不同模型。到了 10M+ 请求的桶,平均有 35 个模型被常规使用。从 1M 到 10M 桶的 18 个模型跃升到 10M+ 桶的 35 个模型,这是一个转折点。 一个 35 个模型组成的舰队作为一个路由图运行:一个廉价的分类器用于意图检测,一个前沿模型用于推理步骤,一个嵌入模型用于检索,一个快速模型用于摘要,以及一个视觉模型用于截图。其中每一个模型都是可替换的。如果某个供应商涨价、质量下降或发生故障,流量会在数小时内重新分配到其余模型。在产生排行榜上大部分支出的规模上,在实验室之间切换更接近于配置更改,而不是供应商迁移,并且关于实验室锁定的标准故事在请求量曲线上越高越不成立。 ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#new-models-are-adopted-rapidly)新模型被迅速采用 同样的舰队设计解释了新版本发布被吸收的速度。当一个新版本在某个模型家族内发布时,流量会在数周内转移到它上面。 Claude Sonnet 4.6(https://vercel.com/ai-gateway/models/claude-sonnet-4.6)在发布后的第一个完整月就吸收了 Sonnet 家族的大部分份额。 Opus 家族现在也正经历同样的形态,Claude Opus 4.7(https://vercel.com/ai-gateway/models/claude-opus-4.7)以几乎相同的曲线从 Opus 4.6 那里夺取份额。 前代模型在这两个窗口期内都保持在 AI 网关中可用并可路由,但团队还是选择了迁移。迁移只是一个配置更改,实验室不再能自行设定其产品线的升级时间表。 ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#provider-outages-have-a-hidden-cost)供应商中断存在隐性成本 大约 3.5% 的 AI 网关请求是通过回退完成的。这意味着初始路由遇到了错误、速率限制或超时,网关以足够快的速度将请求重新发到一个健康的备用节点,用户仍然得到了成功的响应。 按 token 衡量,救援率为 5.1%,按美元计算为 4.9%。按 token 加权和按成本加权的比率高于按请求加权的比率,因为被救援的请求平均而言比未被救援的请求更大、更昂贵。长上下文窗口比短窗口更容易遇到速率限制,多步骤智能体运行会在各步骤中累积失败,而高推理量的调用会在持续负载下超时。每一种故障模式都针对工作负载中昂贵的一端,这就是为什么美元比率高于请求比率的原因。 一个供应商的 SLA 衡量的是请求级别的可用性,但生产应用体验的是成本加权的可用性,而这两者恰恰在那些为模型付费的调用上分道扬镳。 ## 链接到标题(https://vercel.com/blog/ai-gateway-production-index#conclusion:-build-for-workload,-not-the-lab)结论:为工作负载而构建,不是为实验室 生产工作负载是为了效率、可靠性和灵活性而设计的,而不是为了匹配最新的模型排行榜。 对相同数据的六次不同切片,其底层形态始终如一。不同的实验室赢得同一应用的不同层级,而处理这些层级的架构正是规模化的生产团队已经构建好的。 这呼应了早期的云计算时代。团队首先扩展计算能力(更多实例、区域、冗余),随后再压缩每单位成本。在支出曲线顶端的 35 个模型舰队,正是以更快节奏重复相同的模式;随之而来的优化发生在路由层。 对于今天交付 AI 的人来说: - 规划跨供应商的多模型 - 假设需要回退机制以优化可用性和成本 - 从一开始就将路由设计为核心架构单元 我们计划随着模式的变化定期重新审视这些数据。实时模型排名可在 AI 网关排行榜(https://vercel.com/ai-gateway/leaderboards)上查看。 ### 链接到标题(https://vercel.com/blog/ai-gateway-production-index#about-this-data)关于本数据 本分析基于 Vercel AI 网关截至 2026 年 4 月的匿名聚合路由数据。 几点测量说明: - *支出* 使用市场价格(公布标价)来提供标准化视角,适用于自带 API 密钥的团队。 - *用量* 统计通过 AI 网关路由的 token 数量。 - *B2C*、*B2B* 和 *用例* 分类均为汇总数据。未识别任何单个团队或工作负载。

相似文章