开源AI现状(15分钟阅读)
摘要
Mozilla发布的《开源AI现状》报告指出,开源权重模型在许多任务上已与闭源模型达到同等水平,同时推理成本在36个月内下降了50倍。目前,大多数生产环境中的token通过开源模型路由,竞争格局已转移到上层的智能体层。
开源权重现在已成为实际工作的核心。大多数生产环境中的token通过它们路由。OpenRouter上流量最高的五个模型均为开源模型。闭源模型在尖端领域仍占领先地位,但尖端并非大多数工作负载所需。
查看缓存全文
缓存时间: 2026/07/15 22:57
# 开源人工智能现状 —— V1.0 · 2026年7月
Source: https://stateofopensource.ai/
Mozilla
V1\.0 · 周期性更新 · 2026年7月
来自我们首席技术官拉菲·克里科里安的一封信
在新西兰最北端,一位毛利广播员正在训练 te reo 毛利语的语音模型——这是一种对任何市场都过于小众的语言——采用的许可证确保数据始终属于其族群。全球最大的会计师事务所之一普华永道 (PwC) 在金融语言上微调了一个开放模型,如今在其自有硬件上为数百家客户运行,无需按 token 计量。洛桑的研究人员与红十字会共同构建了一个开放医疗模型,并依据其人道主义准则进行了调优,正在瑞士和坦桑尼亚筹备临床试验。在东非,农民使用一个直接在手机上运行的模型诊断木薯病害,该模型可在云端从未触及的田间离线工作。在瑞士,一个公共联盟在公共超级计算机上训练了一个国家级模型,并开放了全部内容:权重、数据、训练代码。他们中没有任何人请求许可,也没有任何人能够租用这些资源。他们拥有这一切——这就是全部理念。
我们曾经历过类似局面。Mozilla 的诞生,是因为一家公司试图掌控网络的前门,而一个开放社区奋起反抗,确保它永远无法得逞。二十五年后的今天,有人在重施故伎。我们第一次押注开放。开放赢了。我们可以再次携手,重演这一幕。
我们的信念很简单:前进的道路是竞争和互操作性。我们相信一个拥有众多模型、标准化的集成方式,以及随时可以离开任何供应商的自由的世界。开放在这方面有迹可循。它做大了蛋糕,让更多人能分得一块。
请将下文视为一幅地图:开放人工智能在哪里获胜——有些数字甚至让我们自己惊讶——又在哪里面临风险。一个隐藏自身弱点的案例,不过是广告而已。
开放权重缩小了能力差距,而智能的价格则大幅下跌。
0%
与顶级闭源模型的能力差距 —— 在编码方面持平,在推理方面落后
0×
GPT-4 类推理成本在36个月内的下降幅度:$20 → $0.40 每百万 tokens
01开源人工智能的当前状况
## 已达到持平。竞争已上移一层。
开放权重不再是一种妥协。它们是实际工作发生的地方:大部分生产环境的 token 现在都通过它们路由,OpenRouter 上流量前五的模型全部是开放权重。闭源模型在前沿领域仍领先,在推理和多模态方面,但前沿并非大多数工作负载所需。通用化输入不具备定价权。价值向上迁移,进入代理化框架。
能力差距:8.04% → 0.5% → 3.3%
24个月内 Chatbot Arena 上的开放与闭源差距。到2024年8月,差距已缩小至0.5%,2025年2月,DeepSeek-R1 短暂追平了美国顶级模型。到2026年3月,差距重新扩大至3.3%,因为闭源推理模型领先了。但3.3%是一个锯齿状前沿的平均值:开放模型在编码、指令遵循和通用知识方面持平或接近持平,而差距集中在推理、长上下文检索和代理任务。问题不再是开放模型是否足够好。而是你的工作负载需要什么。鼠标悬停可查看各点数据。
来源:Chatbot Arena,2024年1月 – 2026年3月。
推理成本在36个月内下降了50倍
每百万 tokens 的 GPT-4 等效价格 —— 下降速度超过互联网时代带宽或个人电脑计算价格曲线。对数刻度。
来源:斯坦福 HAI 2025年AI指数(18个月内 GPT-3.5 类下降280倍);Epoch AI(每年下降9–900倍);2025年11月麻省理工学院研究(前沿领域每年5–10倍,经硬件调整)。
开放权重赢得 token 量
OpenRouter 上通过开放权重模型路由的 token 比例,从微乎其微的基础增长到2025年底的三分之一,到2026年中成为多数。
来源:OpenRouter 100万亿 token 研究(2024年11月–2025年11月)及实时排行榜;中间点经插值处理。按请求数量计算,美国闭源提供商仍领先——开放权重领先的是 token 量,集中在编码和代理工作负载。
OpenRouter 实时排行榜 —— 过去一个月路由的 token 量
流量前五的模型全部是开放权重。Anthropic 的闭源 Claude 模型是下一个美国构建的参赛者。
开放权重闭源
到2026年中,前九大模型中,中国构建的模型每周路由约18万亿 token,而美国构建的约为5.5万亿——超过3:1的比例(英国《金融时报》分析)。开发者根据成本路由时,会转向开放权重。
## 开源易于发布。开源难以部署。
数据来自 Mozilla / SlashData 2026年开发者调查。开放模型在采用率上领先:79% 添加AI功能的开发者使用开放模型,而闭源模型为71%,两者在很大程度上互补,一半的开发者同时使用两者。但在生产阶段,团队遇到瓶颈:只有51%的开放模型团队进入生产,而闭源模型为63%。差距在于运维工具和信任,而非模型能力。
开放模型在采用率上领先,且大多与闭源共存
目前正在使用的开发者,按模型类型划分,以及两者的重叠情况。
两者如何结合
29%仅开放
50%两者都用
21%仅闭源
来源:Mozilla / SlashData 2026年开发者调查。开放和闭源对大多数团队并非替代关系:50%同时运行两者,29%仅用开放,21%仅用闭源。
开放采用率峰值地区,以及闭源仍占优势的地区
按地区划分的开放模型采用率。大中华地区和东亚领先,达89%;南美洲和西欧是仅有的两个闭源采用率超过开放的地区。
同一调查,按开发者地区划分。在南美洲和西欧,且仅在这两个地区,闭源模型采用率领先于开放。
按公司规模划分的生产率
如果差距源于资源,规模效应本应缩小它,但事实并非如此。闭源模型的生产率从54%上升至73%。开放模型几乎不变:53% → 57%。
闭源模型开放模型
企业可以通过付费解决闭源部署中的问题。开放部署则等待尚未完成的工具。来源:Mozilla / SlashData 2026年开发者调查。
团队流失原因:使用开放模型面临的挑战
Δ = 已流失 − 仍在使用的百分比。最大差距(性能、集成、维护)属于运维层面,而非能力层面。鼠标悬停可查看各柱状图。
仍在使用开放模型已流失
Mozilla 调查,n=1,410。“你在使用开放或开源AI模型时面临的主要挑战是什么?”
相同的挑战,无处不在:按地区划分的开放模型阻塞因素
按地区划分,当前和已流失的开放模型开发者中提及各挑战的比例。颜色越深表示越多开发者受阻。顶部几行在所有地区都是运维层面的:基础设施成本、安全与合规、维护、部署复杂性。南亚最依赖安全和支持;只有北美和大中华地区有超过15%的开发者报告没有重大挑战。
来源:Mozilla / SlashData 2026年开发者调查 (MZCS1)。n=1,410 当前或已流失的开放模型开发者;大洋洲列 (n=39) 和东欧及独联体列 (n=98) 低于可靠阈值。
---
02开源人工智能堆栈
## 开源堆栈在能力上得分高,在运维上得分低。
九个层级和48个组件,按10个标准评分(1–5分)。点击一个层级可查看其组件:每个组件都有自己的标准评分、成熟度等级、开放与闭源持平评估,并列出一些星级最高的开源项目。
鼠标悬停任意单元格可查看详情。
强成熟可行,但分散早期阶段
强 (≥4.0)3.5–3.93.0–3.42.5–2.9弱 (<2.5)运维差距 = 标准化 + 企业就绪度
各单元格按成熟度标准评分(1–5),从左到右由强到弱排列;层级行是其组件的平均值。最冷的两列——标准化和企业就绪度——在每个层级和每个组件中重复出现:这个重复的冷边缘就是运维差距。来源:Mozilla 堆栈地图,2026年6月(48个组件,1,361个项目)。
---
03谁在押注
## 开源是一种商业模式。
开放权重AI是一个数千亿美元规模的商业市场,由资金充足的公司构建,并由全球企业在生产中运行。Databricks 的营收运行率突破54亿美元;Mistral 在12个月内规模扩大20倍,年经常性收入 (ARR) 达到约4亿美元;DeepSeek 的 ARR 达到约2.2亿美元,最近以超过500亿美元的估值融资74亿美元。五种收入模式已在大规模上得到验证:托管推理、企业平台、本地部署许可、微调服务和框架工具。
风险投资支持的开源生态系统:已披露总融资额,百万美元
条形图随滚动增长。按公司所在地区着色。
北美中国欧洲及世界其他地区
部分公司;智谱AI 和 MiniMax 已上市(2026年香港IPO),但未公开总金额。战略投资者(英伟达、Salesforce、AMD、谷歌、IBM、ASML、腾讯、宁德时代、Schwarz集团)为同一生态系统提供支持,覆盖模型、推理和工具层。
开源生态系统的财务成熟度
承载开源堆栈的公司的融资、估值和营收情况。该生态系统已从赠款阶段发展到风险投资规模,再到公开市场。
五种收入模式已在大规模上得到验证:托管推理、企业平台、本地部署许可、微调服务和框架工具。“—”表示未公开披露。
计量模式在规模下失效
闭源前沿模型按 token 销售——在生产规模下,计量成为问题。
五分之一的使用量,4%的收入
在 OpenRouter 上(2025年5月–9月),闭源模型约占80%的使用量和约96%的收入。价格是驱动因素:在约90%的能力持平情况下,闭源每次调用成本高出约6倍。
~248亿美元
未实现的年节省额——Nagle–Yue 研究为 Linux 基金会估算的开放与闭源价格不对称性,按每次调用成本约6倍计算,能力相当
开发者根据成本路由时,会转向开放权重。
---
04为什么这种情况无处不在
## 开放不是供应商选择。这是主权选择。
超过70个国家的人工智能战略已经出台。战略问题已从是否要有国家AI政策,转变为国家能拥有堆栈的哪一层。
点击下方标记或国家。
开放的理由是可选性
可选性在2026年6月不再抽象,也不再是采购问题。 Claude Fable 5 上市三天后,一个政府的出口命令迫使 Anthropic 切断地球上所有外国公民的访问权限。没有征求其他任何政府的意见,也不可能征求。选择性合规是不可能的,于是这些模型在一个周五下午5:21对所有用户下线。任何基于该模型构建的人都继承了一次没有预警、且无法参与的关闭事件。供应商可以关闭一个模型。但没有人能关闭一个已经在你拥有的机器上运行的副本——这台机器可以是一家创业公司的服务器,也可以是一台国家超级计算机。对于公司而言,磁盘上的权重是对冲工具。对于国家而言,这决定了是拥有政策还是需要获得许可。
开放的战略理由在于拥有离开的能力,而云时代已经证明了缺乏这种能力的代价:
**9万到12万美元**将1 PB数据迁出AWS S3的费用
**80%**的企业正在将工作负载迁回本地
**320万美元 → 不到100万美元**37signals 离开云后的账单
**2.5倍**GEICO 超出计划的云成本
闭源模型API重现了同样的陷阱:基于专有端点构建,你就会继承供应商的价格变动,且没有干净的退出路径。开放权重就是退出权。
开放权重的最大来源是中国。这是有意为之。
Hugging Face 累计下载量,2026年3月:
2026年2月,Qwen 的下载量超过了之后八个组织的总和。在 OpenRouter 上,中国开放权重模型的 token 占比从2024年底的不到2%上升至2026年4月每周流量的45%以上,在最常用的十个模型中约占61%。DeepSeek 报告拥有26,000多个企业账户;2025年新成立的AI初创公司中,58%在其技术栈中包含了 DeepSeek,即使至少有八个司法管辖区限制了其托管服务。解决方案是架构性的:企业禁止托管应用,但仍采用权重,通过自托管或西方端点。
这是有意的政策。国务院于2025年8月发布的“人工智能+”行动及2026年3月的国家五年规划,将开源推广作为核心指令,而公开权重同时充当了针对半导体出口管制的宏观对冲策略,将全球推理负担卸载到最终用户的本地硬件上。在全球南方,驱动因素是摆脱美国技术垄断的多元化;在其他地区则纯粹是财务考量。就连微软也正在探索在 Azure 上托管一个安全的 DeepSeek V4 版本,用于其最繁重的 Copilot 工作负载。
标记大小 ≈ 已承诺的公共/战略资本规模 · 等距圆柱投影
来源:开源人工智能管辖区数据集,2026年7月。标记大小随已承诺的公共和战略资本规模变化。
---
05框架是新的前沿
## 代理框架是另一种用户代理。
浏览器曾是开放网络的用户代理:用户端的代码,代表用户与服务器协商。这一角色正在更高一层被重新创造。现在,模型之上是代理框架——编排循环、工具、记忆、沙箱和权限模型。这里是生产难度集中的地方,也是开放与闭源、拥有与租赁之争重启的地方。
**用户 · 其他代理 · 世界**人类 · 系统 · 数据 · 资金
**治理**跨多个框架的统一平面
**有状态策略**会话已完成的操作
**注册与溯源**哪个代理做了什么
**预算与撤销**成本上限 · 终止开关
元框架 · Omnigent · OPA · 代理治理工具包
**表层**连接用户与资金
**接口**AG-UI · A2UI
**支付与计量**x402 · AP2 · UCP
**行动**安全地执行操作
**沙箱与执行**E2B · Daytona · Modal
**权限与身份**写入表面——未解决的差距
**评估与可观测性**Langfuse · Phoenix
**连接**连接与记忆
**工具与上下文**MCP
**代理间通信**A2A
**记忆**Mem0 · Letta · Zep
**控制**驱动循环
**编排循环**LangGraph · CrewAI · AutoGen · LlamaIndex — 将模型转化为代理的推理与行动循环
**模型——权重**开放或闭源 · 可替换 · 逐步商品化趋近于零
这一层已成为一个产品类别:仅 LangChain 就拥有12.6万多个 GitHub 星标和60%的开发者份额;MCP 在第一个年内 SDK 月下载量达到9700万,活跃服务器超过1万个,16个月内增长4750%——并于2025年12月捐赠给了 Linux 基金会的 Agentic AI Foundation。采用速度超过了治理水平:只有约21%的公司报告拥有成熟的代理治理机制。
模型正在吞噬框架,而这正是开放的机会
Terminal-Bench 2.0 (https://www.tbench.ai/leaderboard/terminal-bench/2.0)(2026年5月)让框架看起来像任何人都能获得的免费午餐:一个第三方脚手架在 Anthropic 自己的权重上达到了79.8%,而 Claude Code 在相同模型上仅为58.0%,相差21.8个百分点,这表明框架胜过了权重。八周后,Terminal-Bench 2.1 (https://www.tbench.ai/leaderboard/terminal-bench/2.1) 逆转了这一局面。前沿实验室看到了这个结果,将框架收归内部:在两者都出现的每个模型上,实验室自己的框架现在胜出,21.8个百分点的差距已压缩到前端的约3个百分点——模型向上吞噬整个堆栈,权重与框架作为一个产品交付。
2026年5月 · Terminal-Bench 2.0
2026年7月 · Terminal-Bench 2.1 · 官方排行榜,验证的顶级梯队的
这种整合正在形成一条护城河,实验室有充分的动力去加深它。一个与某个实验室权重紧密调优的框架会成为一种专配,而非中立层。它在其他任何模型上的表现都会下降。
相似文章
企业界对开源AI的看法都是错的(3分钟阅读)
Decagon 将 90% 的工作负载运行在微调后的开源模型上,以获得低延迟和高性能;而由于使用前沿模型的新用例激增,企业整体在开源大语言模型上的支出已降至 11%。文章认为,随着用例逐渐成熟,它们将从闭源模型迁移到开源模型。
人工智能的经济因素开始倾向于开放模型
本文探讨了市场力量和经济因素,这些因素正日益倾向于开源AI模型而非专有替代方案。
开源模型落后了多少?(17分钟阅读)
LessWrong上的一篇分析,探讨了开源与专有AI模型之间的性能差距。
开放与封闭AI模型:2025-2026年差距如何缩小及未来走向
本文探讨了从2025年初到2026年中,开放与封闭AI模型之间的性能差距如何急剧缩小,以DeepSeek开放模型的发布及其后续市场影响为例。文章还讨论了中国实验室在推动开放前沿方面的作用及其对行业的影响。
为什么开源AI的崛起尚未对Anthropic构成威胁……目前
一篇探讨开源AI模型崛起为何尚未对Anthropic等前沿实验室造成负面影响的文章。数据显示,尽管开源模型处理的token量更大,但前沿模型因用于早期部署阶段,仍占据了大部分支出。