开源权重模型正在悄然封闭——这是一个问题
摘要
文章认为,开源权重AI模型变得愈发受限的趋势对市场竞争构成了威胁,因为这些模型目前为对抗前沿闭源模型提供商提供了必不可少的价格约束和隐私选项。
<p><a href="https://lobste.rs/s/jvvtif/open_weights_are_quietly_closing_up_s">评论</a></p>
查看缓存全文
缓存时间: 2026/05/08 09:38
# 开源权重模型正在悄然封闭——这是个问题
来源:https://martinalderson.com/posts/open-weights-are-quietly-closing-up/
在 LLM 领域,"会有具有一定竞争力的开源权重模型"几乎被视为理所当然。但我不确定这一假设是否仍然成立。
## LLM 简史
在 LLM 相对短暂的历史中,存在两种类型的模型——闭源和"开源权重"。闭源模型几乎涵盖 OpenAI 的所有产品(尽管名字里有"Open"!),而开源权重模型则由其他实验室发布。Llama 系列模型是开源权重的典型代表,但更近一段时间,中国实验室如 MiniMax、Z.ai、DeepSeek 和 Qwen(阿里巴巴)成为了开源权重模型的领头羊,Google 的 Gemma 系列和 OpenAI 的 `gpt-oss` 模型通常落后于中国的这些模型。
开源权重模型允许任何人在自己的硬件上**运行**模型。通常,值得运行的模型需要非常强大的硬件——但这种情况正在迅速改变,较小的模型正变得愈发实用。
能够在本地运行这些模型——而非通过 API 调用 OpenAI/Anthropic/Google——主要有三大优势。
首先,隐私与合规。如果你拥有(非常)敏感的数据,通过 API 将其发送到前沿实验室的数据中心是困难/不可能的。能够在"本地"运行模型意味着数据无需离开你的网络。
其次,更大的灵活性。你可以将这些模型作为微调的基础,或者根据你的硬件标准对模型进行量化(大致可以理解为压缩)。
最后,也是本文重点关注的:成本。它们可以比前沿模型**便宜得多**。显然,如果在自己的硬件上运行,你只需承担硬件的资本支出以及电费和运维成本。但**更重要**的是,有数十家公司会以托管方式为你运行这些模型,通常每 token 的成本不到前沿模型的 10%。
## 为什么开源权重模型如此重要
借用经济学中"可竞争市场理论"的概念:即使在垄断(或寡头垄断)市场中,当存在廉价且可信的替代方案时, incumbent 企业往往会表现出竞争性。这并非完美契合——该理论严格假设沉没成本接近零,而这显然与前沿训练相反——但其底层机制是成立的。威胁是**潜在的**;消费者可以选择切换,这正是约束定价的力量。
本质上,我认为开源权重模型对前沿实验室施加了显著的降价压力。这并非绝对——显然,人们愿意为更高质量的模型**以及**与一家市值约万亿美元公司签订的推理合同(而非通过 OpenRouter 的廉价推理提供商)支付(高得多的)费用。OpenAI 等公司提供 SLA 以及关于保密性等事项具有法律约束力的承诺。
但在我看来,这确实提供了足够的下行压力,使得原本可能出现的寡头垄断市场行为难以抬头。如果前沿实验室(当然,纯属巧合地)在一夜之间将价格提高 5 倍,将有大量用户**转向**开源权重模型,尤其是在要求不高的使用场景中。
从价格行为的角度来看,我把开源权重模型比作仿制药。如果仿制药存在,大型制药公司会大幅降价以接近仿制药价格,并将精力集中在"领先"于仿制药的新疗法上,以维持价格。
如果没有开源权重模型,前沿实验室将拥有比现在大得多的定价权。
## 许可证正在发生变化
然而,开源权重模型的可用性并非理所当然。训练这些模型成本高昂,背后的公司都是商业公司——或许(在很大程度上?)得到了中国国家的补贴——但它们不是慈善机构。
事实上,我们已经看到这些模型的许可条件显著收紧。Meta(到目前为止)完全放弃了其最新"Muse Spark"模型的开源权重,根本不发布。
阿里巴巴越来越多地首先(或在某些版本中,仅)通过其 API 发布模型。Kimi 的 K2.6 许可证增加了归属条款——如果你拥有超过 1 亿月活跃用户或每月 2000 万美元收入,你必须在产品 UI 中显著展示"Kimi K2.6"。法国的 Mistral 也对商业使用施加了不同的许可条件。
也有例外——DeepSeek 实际上变得**更加**宽松,但公平地说,总体趋势是许可更加严格(而且 Meta 和阿里巴巴都停止发布部分/全部模型)。
## 接下来会发生什么?
在(目前假设的)一年后,我们可能会面临这样一种情况:大多数或**所有**此前最好的开源权重模型都不再发布。虽然它们之间当然会存在价格竞争,但如果训练这些模型的成本和复杂性持续增加,我们有理由假设最终可能只剩下少数玩家——西方三大前沿实验室和少数中国实验室——或者可能出现国家主导的"合并",将它们整合为一到两个中国"超级实验室"。这种战略性行业的整合有大量先例——中国已经在铁路(中车)、核能、航空和电信领域这样做了,西方也无法幸免——看看冷战后整合后的国防巨头就知道了。
其影响 frankly 令人担忧。AI 产生了巨大的消费者剩余——我从 token 成本中获得的价值远超其价格,即使价格涨 10 倍我也会毫不犹豫地支付。对于高价值的专业或智能体工作,我愿意支付的价格与实际支付的价格之间的差距更大。如果没有开源权重模型的底线,寡头垄断将有机会攫取这一差距。
在这种情况下,经济理论指向权力和经济财富向少数公司历史性集中——实验室将直接把消费者剩余转化为利润。而且,由于只有少数几家公司的寡头垄断以及进入壁垒极高(新模型的资本支出),价格竞争可能会非常有限。
同样,这种反乌托邦的愿景可能也是杞人忧天。也许随着硬件越来越快,训练一个"足够好"的模型实际上会随时间推移变得**更容易**。而且,尽管硬件制造商寥寥无几,我们看到 AI 硬件领域存在激烈竞争。蒸馏——用前沿模型的输出训练更小的模型——有时被提及作为一种释放阀,但它仍然依赖于首先能够访问强大的基础模型,而这正是此处面临风险的东西。
一个竞争激烈的开源权重生态系统一直是整个 AI 经济中一个默默承担重任的假设。值得关注的是,它正在侵蚀——而对更广泛经济的影响是巨大的。
---
1. 严格来说是三种——开源权重模型只发布最终的"模型"。另一类被称为"完全开源"或"可复现",还包括所有训练数据和相关训练过程文档,这可能最类似于我们软件领域所知的**开源**↩︎ (https://martinalderson.com/posts/open-weights-are-quietly-closing-up/#fnref1)
2. OpenRouter 提供"API 的 API",将你的请求路由到特定模型最便宜和/或最可用的推理提供商。这极大地提高了可靠性,因为如果一个提供商出现问题,它会立即切换到另一个提供商。同样,如果有更便宜的提供商可用,它也会切换——这确实是 Milton Friedman 的梦想↩︎ (https://martinalderson.com/posts/open-weights-are-quietly-closing-up/#fnref2)
相似文章
开放权重 vs. 封闭:一场AI内战正在酝酿,关乎存亡
本文探讨了开放权重与封闭AI模型之间日益激烈的冲突,重点讨论了关于蒸馏以及中美紧张局势的辩论,微软和许多科技巨头支持开放权重。
开放权重模型的权衡(9分钟阅读)
对开放权重AI辩论的分析:支持者认为它使AI民主化,而批评者则指出滥用风险;多家大型科技公司签署了支持开放权重的公开信,而Anthropic和特朗普政府的部分成员仍保持谨慎。
我看不出世界各地的政府和企业现在有何理由不在中期内转向开放权重模型。
作者认为,政府和企业将越来越多地转向开放权重的人工智能模型,以避免美国政府对访问权限的控制,并指出开放模型仅稍落后于封闭模型,其发展速度更适合现实世界的官僚体制。
开放权重并不意味着你能控制你的数据
本文认为,开放权重模型并不能保证数据控制,因为大多数用户依赖托管API,导致数据离开用户环境,这对于敏感的企业数据至关重要。
开源权重模型并非通过抄袭来追赶闭源模型,它们之所以胜出,是因为整个AI堆栈正在悄然模块化
本文认为,开源权重AI模型追赶闭源模型并非通过蒸馏技术,而是得益于AI堆栈的模块化——稳定的接口(Transformer架构、兼容OpenAI的推理API、智能体框架)使得创新能在整个生态系统中迅速扩散,在缩小能力差距的同时保持巨大的价格优势,最终可能导致前沿AI的商品化。