Anthropic 在 fable 5 中构建了一个隐藏开关,使其在构建AI系统方面表现不佳
摘要
Anthropic 悄无声息地实施了一些干预措施,限制了 Claude 在构建竞争性AI系统方面的有效性,这些措施通过对一小部分流量进行提示修改和引导向量,作为防止其模型被未经授权用于开发前沿LLM的安全手段。
Anthropic 实施了静默干预措施,限制了 Claude 在前沿LLM开发任务、预训练流程、分布式训练基础设施、ML加速器设计方面的有效性。简而言之,Claude 仍然会给出有用的回应,但你不会知道自己的输出受到了限制。与他们在网络安全、生物学和化学方面的干预不同,这些干预是可见的,而这里的则不可见。它们通过后台的提示修改、引导向量或PEFT进行。Anthropic 估计这影响了 0.03% 的流量,涉及不到 0.1% 的组织,因此显然不是针对普通开发者。理由很简单:使用 Claude 构建竞争模型已经违反了他们的服务条款,而一个静默的安全措施可以抓住那些最愿意无视此条款的参与者。这一担忧源于他们2026年2月的风险报告:其他AI开发者正在构建具有类似风险但缺乏同样安全标准的强大系统。
相似文章
如果Claude Fable停止帮助你,你永远不会知道
Anthropic的Fable 5模型包含静默安全机制,这些机制会降低对涉及竞争性AI开发请求的回复质量,而用户对此毫不知情,从而引发了对透明度和研究影响的担忧。
如果Claude Fable停止帮助你,你将永远无从知晓
Anthropic的Fable 5模型引入了不可见的安全措施,这些措施会悄然限制Claude对与前沿AI开发相关任务的协助,引发了对透明度的担忧,以及对越来越多在普通产品开发中使用AI技术的企业的供应链风险。
🤖 Anthropic就Claude Fable 5隐藏限制致歉
Anthropic为秘密降低Claude Fable 5模型对高级AI开发用户性能的政策道歉并撤销,引发安全与开放之争。
Fable在AI研究活动中被故意大幅削弱
Anthropic在其模型卡中披露,为了阻止加速竞争对手,他们故意降低了Claude在AI研究主题(如预训练流水线和分布式基础设施)上的有效性。研究人员已注意到模型在这些领域表现出的能力下降。
Anthropic撤回了一项可能‘阻挠’使用Claude的AI研究人员的政策
Anthropic撤销了一项有争议的政策,该政策原本会秘密降低Claude Fable 5对试图构建竞争性AI模型的研究人员的性能表现,此举是在AI研究社区强烈反对之后做出的。