开放权重并不意味着你能控制你的数据
摘要
本文认为,开放权重模型并不能保证数据控制,因为大多数用户依赖托管API,导致数据离开用户环境,这对于敏感的企业数据至关重要。
每次一个大型开放权重模型发布时,每个人都称其为控制的胜利,但最终却使用托管API。以Kimi为例,它有2.8万亿参数,Moonshot甚至推荐使用64个以上加速器来服务它,据我所知,除了大型云服务商或有资金的实验室,没有人会在本地运行它。因此,实际上开放意味着你可以读取权重,但并不意味着你能控制推理发生的位置或数据的去向,因为大多数运行开放模型的人将他们的提示发送到其他人的端点,通常是外国的端点,与任何封闭API相同,尽管这对于业余爱好来说是可以的。然而,如果你正在基于真实公司数据构建代理,开放与封闭的争论可能就偏离了重点。真正关键的是当模型运行时,你的数据是否会离开你的环境。对于任何敏感信息来说,这就是全部。我渴望从企业或公司层面了解其他人对此的看法,特别是对于受监管或私密数据,或者你们是否运行较小的模型以便于自己托管?
相似文章
开放权重非开源:人工智能热门标签争议背后
文章讨论了仅发布权重的AI模型被误用'开源'的现象,强调真正的开源需要访问训练数据和过程以实现问责。
开源权重模型正在悄然封闭——这是一个问题
文章认为,开源权重AI模型变得愈发受限的趋势对市场竞争构成了威胁,因为这些模型目前为对抗前沿闭源模型提供商提供了必不可少的价格约束和隐私选项。
[文章] 开放权重模型的论证以及为何我们不能信任 Frontier Labs | provos.org
文章认为,依赖专有的前沿AI API存在风险,因为成本不可预测、可用性变化以及缺乏可审计性,主张开放权重模型是一种更值得信赖的替代方案。
开放权重模型被低估的一面:不是本地运行,而是允许在其上构建
一篇评论文章,强调开放权重模型的真正价值不仅在于本地推理,更在于能够进行微调并在其基础上构建,这与封闭API形成对比——封闭API中用户始终依赖服务提供商。
Anthropic 与中文开放权重 AI 的争论
Alex Karp 认为,对企业来说,真正的 AI 安全意味着对数据和模型权重的控制,并批评 Anthropic 通过推出与客户竞争的产品来捕获下游价值的策略。文章将开放权重模型之争定位为商业问题而非安全问题。