开放权重模型被低估的一面:不是本地运行,而是允许在其上构建

Reddit r/artificial 新闻

摘要

一篇评论文章,强调开放权重模型的真正价值不仅在于本地推理,更在于能够进行微调并在其基础上构建,这与封闭API形成对比——封闭API中用户始终依赖服务提供商。

关于开源与闭源的讨论,大多集中在能否在自己的硬件上运行模型。公平地说,这是最明显的吸引力。但我认为被忽视的一点是,开放权重意味着你可以在基础模型上进行后训练(post train),而不仅仅是运行推理。使用封闭API时,你是在租用智能。你可以提示它,可以围绕它做RAG(检索增强生成),但你永远无法让它成为你自己的。你不能针对自己的领域微调实际的权重,你无法将其蒸馏缩小,你无法冻结一个版本并永久拥有它。你永远处于提供商决定的下游。我看到有人发帖说,现在GLM-5.2开放权重后,他们正在其上后训练自己的模型。这个说法比基准测试数字更让我印象深刻。一个前沿级别的基础模型,且你可以合法地在其上构建,这改变了一个小团队能做的事情。你不需要从头训练,你可以从已经很强的东西开始,然后进行专门化。实际上,我们大多数人不会在地下室里微调一个700B参数的模型——计算量太残酷了,我不会假装不是这样。但选项本身的存在就是关键。即使租用云计算资源来后训练你自己的变体,也与完全被锁定权重之外是完全不同的情况。有没有人真的在大规模开放模型上进行后训练?还是说主要仍然只是推理,微调只停留在小模型范围内?
查看原文

相似文章

开源权重模型并非通过抄袭来追赶闭源模型,它们之所以胜出,是因为整个AI堆栈正在悄然模块化

Reddit r/singularity

本文认为,开源权重AI模型追赶闭源模型并非通过蒸馏技术,而是得益于AI堆栈的模块化——稳定的接口(Transformer架构、兼容OpenAI的推理API、智能体框架)使得创新能在整个生态系统中迅速扩散,在缩小能力差距的同时保持巨大的价格优势,最终可能导致前沿AI的商品化。

开放权重模型的权衡(9分钟阅读)

TLDR AI

对开放权重AI辩论的分析:支持者认为它使AI民主化,而批评者则指出滥用风险;多家大型科技公司签署了支持开放权重的公开信,而Anthropic和特朗普政府的部分成员仍保持谨慎。

开源模型令人难以承受的廉价

Hacker News Top

本文探讨了像DeepSeek V4这样的开源模型与Anthropic和OpenAI的闭源模型之间的巨大成本差异,认为后者是通过人为稀缺性和品牌效应而非技术优势来维持高价格。