独家:支付前沿AI模型费用可获得4个月领先优势,但成本是五倍
摘要
Mozilla的报告指出,中国公司的开放权重AI模型在性能上仅落后封闭前沿模型4.4个月,但成本仅为后者的一小部分,导致许多组织采用开放模型处理常规任务。
<p>根据Mozilla的报告,美国科技公司的前沿AI模型与中国公司的最佳开放权重模型之间的性能差距已缩小至仅4.4个月。这解释了为什么许多公司正转向使用显著更便宜的开放模型处理常规工作,并有助于揭示一小部分工作负载中前沿模型值得其成本。</p>
<p>根据Mozilla最新的开源AI状态报告,该报告于9月15日发布并在发布前分享给Ars,大多数组织理想情况下应将开放模型作为其大部分工作的默认选择。报告强调了领先的开放模型Moonshot AI的Kimi K3如何在<a href="https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index">Artificial Analysis Intelligence Index</a>上取得综合AI性能评分,仅比Anthropic的Fable 5封闭前沿模型落后3分,同时成本仅为后者的30%。</p>
<p>“封闭模型在少数领域赢得其溢价:专家专业工作、高强度检索和长上下文,”Mozilla首席技术官Raffi Krikorian在一封给Ars的电子邮件中说。“我们认为为封闭模型付费的决定是特定于工作负载的,而非特定于组织。”</p>
<p><a href="https://arstechnica.com/ai/2026/09/exclusive-open-chinese-models-close-gap-with-silicon-valleys-frontier-ai-models/">阅读完整文章</a></p>
<p><a href="https://arstechnica.com/ai/2026/09/exclusive-open-chinese-models-close-gap-with-silicon-valleys-frontier-ai-models/#comments">评论</a></p>
查看缓存全文
缓存时间: 2026/09/15 14:52
# 独家:为前沿AI模型付费,是以五倍成本换取四个月的领先优势
来源:https://arstechnica.com/ai/2026/09/exclusive-open-chinese-models-close-gap-with-silicon-valleys-frontier-ai-models/
Ars预览了Mozilla关于廉价开源模型如何追赶上来的能力报告。
根据Mozilla的一份报告,美国科技公司的前沿AI模型与中国公司最佳开源权重模型之间的性能差距已缩小至仅4.4个月。这解释了为何许多公司正在转向显著更便宜的开源模型处理常规工作——并有助于揭示一小部分让前沿模型值得其成本的工作负载。
根据Mozilla于9月15日发布、在发布前分享给Ars的最新《开源AI状况报告》(https://stateofopensource.ai/),大多数组织理想情况下应默认在大部分工作中使用开源模型。报告重点指出,领先的开源模型Moonshot AI的Kimi K3,在人工智能分析智能指数(https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index)上取得的综合AI性能分数仅落后Anthropic的闭源前沿模型Fable 5三分,同时成本仅为后者的30%。
Mozilla首席技术官Raffi Krikorian在给Ars的电子邮件中表示:“[闭源模型]在少数领域赚取其溢价:专家级专业工作、高强度检索和长上下文。我们看到为闭源[模型]付费的决定是针对特定工作负载,而非整个组织。”
开源权重AI模型允许任何人下载主要模型组件并在自己的计算机上运行,但开发者通常仍然保留关键信息,如训练数据、数据管道和训练代码。相比之下,Anthropic和OpenAI等美国科技公司主要提供闭源前沿模型,将所有内容专有化,要求客户支付更多费用以获取访问权限。
Krikorian解释说,组织仍然为闭源前沿模型付费,因为它们开箱即用,并附带“合规包装、支持和问责制”,而许多组织缺乏足够人员来良好运行开源权重模型。
但开源与闭源前沿模型之间性能差距的持续缩小,加上开源模型的成本效益,现已得到许多公司的广泛认可。例如,外卖公司DoorDash已将Kimi用于常规工作,同时将Fable保留用于通常需要人类专家更长时间才能完成的更困难任务。
毫不奇怪,这加速了开源模型的使用,自Mozilla于7月14日发布首份《开源AI状况报告》(https://blog.mozilla.org/en/mozilla/mozilla-state-of-open-source-ai-report/)以来。
## 衡量性能差距
性能差距的缩小正在通过多种方式衡量。例如,非营利研究机构METR将AI模型的“时间范围”(https://metr.org/blog/2025-07-14-how-does-time-horizon-vary-across-domains/#summary)定义为任务的长度——以人类专家完成所需的时间衡量——AI模型能够以“可靠”的50%成功率处理的任务时长。这个时间范围一直在以固定的节奏翻倍,且该节奏随时间推移而加速。
目前,最好的闭源模型可以处理的任务长度是最优开源模型可靠完成任务长度的1.7倍。
Krikorian告诉Ars:“如果开源前沿模型能处理七小时的任务,闭源前沿模型则能处理十二小时的任务。四个月后,开源模型能处理十二小时的任务,而闭源模型则能处理大约二十小时的任务。”
Krikorian说,通常需要8到12小时的任务是闭源前沿模型可以完成而开源模型尚无法处理的任务。一般来说,没有模型能可靠地处理超过12小时的任务,而耗时少于8小时的任务则可由任一类型模型完成,并可转交给更便宜的开源模型。
此类比较存在许多细微差别和注意事项。例如,闭源前沿模型通常自带“运行框架”(https://arstechnica.com/ai/2026/07/beyond-grep-the-case-for-a-context-rich-ai-coding-harness/)——即帮助模型访问各种工具和记忆以执行类代理操作的软件层。AI实验室为其模型定制的运行框架有时能提升各种任务的性能,而模型在使用第三方运行框架时性能可能较差。
为了公平竞争,基准测试公司Vals AI一直在使用其中立的运行框架评估不同的开源和闭源模型。在“Terminal-Bench 2.1”评估(https://artificialanalysis.ai/evaluations/terminalbench-v2-1)中,当所有模型在同一运行框架上运行时,中国公司智谱AI(Z.ai)的开源权重模型GLM 5.2得分仅比Anthropic的Claude Opus 4.7和4.8低不到一分,而每个任务的成本却低约五倍。
换句话说,为闭源前沿模型付费是以约五倍的单任务成本换取约四个月的领先优势——但仅当着眼于当前需要8到12小时的任务时。
Krikorian告诉Ars:“当这个领先优势值得时,比如在开源前沿模型赶上之前有一个截止日期,那就值得付费。下个季度你仍然要做的常规工作则不值得,因为你很快就能以五分之一的成本完成,而且模型无论如何不会成为瓶颈。”
## 权力集中
开源权重模型日益增长的受欢迎程度可以在OpenRouter(https://openrouter.ai/)上看到,这是一个AI网关和市场,让开发者能够访问来自多个提供商的数百种不同模型。Mozilla报告指出,2026年8月按令牌量排名的前10个模型中,有8个提供开源权重。
然而,开源模型在收入上仍落后于闭源前沿模型。Frank Nagle和Daniel Yue为Linux基金会撰写的一篇论文(https://www.linuxfoundation.org/blog/revealing-the-hidden-economics-of-open-models-in-the-ai-era)发现,开源模型仅获得总收入的4%,而闭源模型获得了96%——尽管他们研究的是2025年5月至9月的数据。
Krikorian说:“在过去一年里,开源模型激增,因此我们预计收入格局已经发生了变化。”
当前的现实是,“世界上运行的大多数开源模型是中国的,”Krikorian说。他解释道:“中国实验室正在采用美国人通过Android玩过的同样策略——免费提供,但拥有围绕它的生态系统。”
但Krikorian并不那么担心“中国模型”,他更担心的是集中的风险。目前,最好的开源模型集中在中国,而最好的闭源前沿模型来自美国公司。他主张美国和欧洲的实验室开始在“相同的开放赛道上竞争,这样就没有单一国家能设定世界的默认标准。”
Krikorian说:“一个令人不安的事实是,围绕开源权重AI的多元生态系统目前主要由中国资本资助。这既是多元的,同时也是集中的。”
Krikorian说,像Linux这样的开源软件发展史可能为“替代性联盟”如何聚集提供一些经验教训。此类开源软件基础设施是由一个由“每个组织都需要这个商品层存在”的组织组成的联盟资助的,其中包括中立的基金会。
Krikorian说,任何构建更多开源AI模型的联盟可能由“有使命的机构而非市场主导”组成,与前沿AI实验室相对。他描述如下:
> 我们需要公共计算项目资助完全开源的参考模型。瑞士的国家级计算项目Apertus就是一个例子。基金会需要坚守它们为互联网开放协议所持的相同中立立场,将其扩展到模型、运行框架和代理标准。从商品模型中获益的公司必须参与。而慈善机构必须覆盖其他任何一方都不会覆盖的部分——特别是评估和审计基础设施。
Krikorian还呼吁替代性联盟更进一步,超越开源权重模型,拥抱更多开源方法。他说:“如果你无法判断模型是如何训练的或基于什么进行评估,就很难完全信任它做出的决策。”
Jeremy Hsu照片(https://arstechnica.com/author/jeremyhsu/)
Jeremy Hsu是一位记者,探索深度技术和AI领域的广泛话题。他此前曾为New Scientist、Scientific American、IEEE Spectrum、Wired、Undark Magazine和MIT Tech Review等众多出版物撰写关于深度伪造、数据中心、无人机、电池技术、机器人技术以及GPS干扰等话题的文章。他还在纽约大学获得了新闻学硕士学位,在宾夕法尼亚大学获得了科学历史与社会学学士学位,并辅修英语。
33条评论(https://arstechnica.com/ai/2026/09/exclusive-open-chinese-models-close-gap-with-silicon-valleys-frontier-ai-models/#comments)
1. 最热文章列表中的首篇配图:“极具性价比”:太阳能前景看好(https://arstechnica.com/gadgets/2026/09/offensively-cheap-solar-power-is-looking-up/)
相似文章
开源AI现状(15分钟阅读)
Mozilla发布的《开源AI现状》报告指出,开源权重模型在许多任务上已与闭源模型达到同等水平,同时推理成本在36个月内下降了50倍。目前,大多数生产环境中的token通过开源模型路由,竞争格局已转移到上层的智能体层。
中国AI模型在美国公司中逐渐崛起,OpenAI和Anthropic成本飙升
中国AI模型正被美国公司越来越多地采纳,因为它们显著更便宜,同时缩小了与领先美国竞争对手的性能差距,自2月以来OpenRouter的代币份额每周均超过30%。
开源模型落后了多少?(17分钟阅读)
LessWrong上的一篇分析,探讨了开源与专有AI模型之间的性能差距。
@FinanceYF5: 3/ 创业公司转向开放模型的速度正在明显加快。 从首次支付OpenAI或Anthropic API,到首次购买开放模型算力,时间中位数从2022年的23个月,缩短至2025年的5个月。 核心原因很直接:部分工作负载的成本可以降低80%。
创业公司从使用闭源API转向开放模型的速度加快,中位时间从2022年的23个月缩短至2025年的5个月,主要驱动力是成本可降低80%。
token用量激增25倍,前沿AI面临定价大考 —— 中端模型以六分之一成本实现旗舰模型90%的能力
token用量激增25倍,前沿AI正面临定价危机;中端模型如今以六分之一的成本即可实现旗舰模型90%的能力,正在重塑先进AI的经济格局。