开放权重非开源:人工智能热门标签争议背后
摘要
文章讨论了仅发布权重的AI模型被误用'开源'的现象,强调真正的开源需要访问训练数据和过程以实现问责。
暂无内容
查看缓存全文
缓存时间: 2026/09/15 23:21
# 开放权重不等于开源:为何AI行业最钟爱的标签正引发争议
来源:https://www.theregister.com/columnists/2026/09/15/open-weights-are-not-open-source-why-ais-favorite-label-is-under-dispute/5295436
人工智能行业惯于滥用"开放"一词。它频繁出现在产品发布、研究论文、政策辩论和投资者报告中。当一家公司将模型文件发布到Hugging Face,开发者在自己的GPU上运行这些文件,该发布很快就被描述为"开源模型"。但这未必准确——它可能仅仅是"开放权重"。
两者区别远非技术细节。这决定了你只能部署现成的神经网络,还是能够真正检查、复现、修改并重新分发其背后的系统。真正的开源系统应当赋予用户执行所有上述操作的自由。
权重是通过训练习得的数值参数。它们与模型架构和推理代码共同支撑大语言模型(LLM)的运行。你可以下载开放权重模型,在本地托管,在内部文档上进行微调,从而避免将提示信息传入专有API。
开放权重是公开可用的。其重要性在于:本地运行模型能提供对数据隐私、成本控制、应对供应商API变更以及避免厂商锁定的更大掌控力。这也催生了庞大的本地模型运行时、推理服务、微调工具及专用下游模型生态系统。
开源倡议组织(OSI)——《开源定义》(OSD)的维护者——明确指出区别:"开放权重指训练完成的神经网络的最终权重与偏置(https://opensource.org/ai/open-weights)。"这些数值决定模型如何解析提示并生成输出。公开权重可使他人微调、适配或部署模型。但OSI补充说明,仅凭权重只能暴露"完全问责所需信息的一小部分"。
斯坦福人类中心人工智能研究院(HAI)主任詹姆斯·兰黛(James Landay)解释道(https://hai.stanford.edu/news/open-weight-models-arent-enough-we-need-truly-open-source-ai-models-for-science-and-society):"开放权重是种进步。你可以下载模型,在自己的设备上运行,避开他人的数据管道。但你仍然无法了解系统如何构建、使用何种训练数据、为何表现出特定行为。这不是开放模型,只是开放分发。"
若缺乏训练数据或足够详尽的文档,外部人员无法确定:模型采用了哪些数据源、可能包含哪些版权或私有材料、数据筛选与剔除的标准、哪些语言和群体被低估、基准测试数据是否渗入训练集,或预训练后的对齐与安全调整如何影响模型。
兰黛继续指出:"开放权重AI与开源AI之间存在巨大鸿沟。"他认为除非开发者公开训练数据并提供"经过完整记录、可审计的说明",否则无法在最完整意义上测试、复现或质疑该成果。
OSI自身对开源AI的定义见《开源AI定义》(OSAID 1.0)(https://opensource.org/ai/open-source-ai-definition)。该定义要求模型参数(包括权重)必须在OSI批准的条款下提供,但未规定具体法律机制。
Lightning AI首席技术官、知名PyTorch贡献者卢卡·安蒂加(Luca Antiga)指出(https://thenewstack.io/osis-definition-of-open-source-ai-raises-critical-legal-concerns-for-developers-and-businesses/),OSAID对权重的处理"存在重大漏洞,将削弱许可证在确定OSI许可AI系统能否实际应用方面的有效性"。
其他开源界人士也批评了OSAID。原始OSD作者布鲁斯·佩伦斯(Bruce Perens)于2024年公开谴责OSAID(https://www.theregister.com/software/2024/05/16/open-source-initiative-tries-to-defines-open-source-ai/1553845)。他后来宣称:"这不是开源!……令人遗憾的是开源倡议组织自身如今也卷入了'开源清洗'。"
持相同观点的绝非少数。软件自由保护组织(SFC)政策研究员兼驻场黑客布拉德利·库恩(Bradley Kuhn)与红帽公司高级商业法律顾问理查德·丰塔纳(Richard Fontana)呼吁废止OSAID,认为:"OSI行动过早,向社区强加了一个过于雄心勃勃的政策妥协方案(https://codeberg.org/OSI-Reform-Platform/platform#readme)。OSAID无疑在自由开源软件(FOSS)社区中制造了裂痕;这道裂痕严重损害了OSI的声誉、权威和影响力。与此同时,OSAID未能显示出对机器学习从业者、FOSS社区或监管机构产生任何积极政策影响的迹象。"
OSI在2024年10月发布OSAID 1.0时承认(https://www.zdnet.com/article/we-have-an-official-open-source-ai-definition-now-but-the-fight-is-far-from-over/),该定义将持续演进。批评者认为其核心缺陷尚未得到解决。
尽管如此,Linux基金会的迈克·多兰(Mike Dolan)已向OSI提交了《开放模型、数据与权重》(OpenMDW)许可证(https://lists.opensource.org/pipermail/license-review_lists.opensource.org/2026-August/006126.html)。该许可证自2025年起存在,贡献者名单包括亚马逊、Meta、IBM、微软和英伟达,拥有坚实的行业支持。
传统开源围绕源代码展开。而大语言模型是截然不同的存在:它融合了代码、架构,以及源自可能涉及专有、版权或未公开数据集的训练数值权重。OpenMDW的解决方案是为模型架构、训练数据和权重分别定义条款,将许可方提供的组件整合于同一协议中。
我认为这方案合理,但该提案在OSI许可证审查邮件列表上遭遇反对。曾主导OSAID制定工作的OSI前执行主任斯特凡诺·马富利(Stefano Maffulli)表示:"我持续感觉到OpenMDW审查受到意识形态偏见影响(https://lists.opensource.org/pipermail/license-review_lists.opensource.org/2026-August/006181.html):因为我们反感大型科技企业,而AI现在就是大型科技,所以我们抵触AI;因此会不惜一切阻止它。"
逃避现实已为时过晚。正如斯坦福的兰黛所言:"开放权重回答'我能运行它吗?'开源回答'我能信任它、改进它并基于它构建新事物吗?'目前几乎所有人——无论美国实验室还是中国实验室——都只回答了第一个问题,离第二个问题还相去甚远。"
两者皆不可或缺。OSI是否采纳OpenMDW仍是未知数。但OpenMDW及其支持者至少在尝试建立涵盖代码、数据和权重的许可框架。若无人成功,"开放AI"恐将成为矛盾修辞——或只是另一个空洞的技术营销术语。®
相似文章
开放权重模型的权衡(9分钟阅读)
对开放权重AI辩论的分析:支持者认为它使AI民主化,而批评者则指出滥用风险;多家大型科技公司签署了支持开放权重的公开信,而Anthropic和特朗普政府的部分成员仍保持谨慎。
[文章] 开放权重模型的论证以及为何我们不能信任 Frontier Labs | provos.org
文章认为,依赖专有的前沿AI API存在风险,因为成本不可预测、可用性变化以及缺乏可审计性,主张开放权重模型是一种更值得信赖的替代方案。
开放权重并不意味着你能控制你的数据
本文认为,开放权重模型并不能保证数据控制,因为大多数用户依赖托管API,导致数据离开用户环境,这对于敏感的企业数据至关重要。
开放权重 vs. 封闭:一场AI内战正在酝酿,关乎存亡
本文探讨了开放权重与封闭AI模型之间日益激烈的冲突,重点讨论了关于蒸馏以及中美紧张局势的辩论,微软和许多科技巨头支持开放权重。
开源?不,是开放遏制
这篇文章批评了将“开源”用于AI模型的做法,认为“开放遏制”更能描述那些公开可访问但仍受安全措施约束的系统。