Anthropic为隐形Claude Fable护栏道歉
摘要
Anthropic为其新Claude Fable 5模型秘密限制速度并设置针对蒸馏尝试的隐藏护栏而道歉,现在将让安全措施可见,并将被标记的查询路由到较旧模型。
<figure>
<img alt="" data-caption="" data-portal-copyright="Image: The Verge" data-has-syndication-rights="1" src="https://platform.theverge.com/wp-content/uploads/sites/2/2026/06/STKB364_CLAUDE_D.jpg?quality=90&strip=all&crop=0,0,100,100" />
<figcaption>
</figcaption>
</figure>
<p class="has-text-align-none">Anthropic为其新AI模型<a href="https://www.theverge.com/news/946725/anthropic-releases-claude-fable-5-mythos">Claude Fable 5</a>秘密限制速度并设置隐藏护栏而道歉,这些护栏削弱了研究人员和竞争对手利用该模型开发竞争系统的能力。该公司表示正在改变方针,并将更透明地说明限制何时生效,即使这意味着Fable会拒绝更多查询。</p>
<p class="has-text-align-none">Fable是Anthropic的Mythos类AI系统中首个广泛可用的模型,该公司数月来一直警告这类系统<a href="https://www.theverge.com/ai-artificial-intelligence/917644/anthropic-claude-mythos-breach-humiliation">过于危险,不适合公开发布</a>。Anthropic表示,通过为Fable设置防止其回应某些“高风险…”的防护措施,已应对部分风险。</p>
<p><a href="https://www.theverge.com/ai-artificial-intelligence/948280/anthropic-claude-fable-invisible-distillation-guardrail">阅读The Verge的完整报道。</a></p>
查看缓存全文
缓存时间: 2026/06/11 13:34
# Anthropic 为隐形限制克劳德·寓言模型的护栏致歉
来源:https://www.theverge.com/ai-artificial-intelligence/948280/anthropic-claude-fable-invisible-distillation-guardrail
Anthropic 已为其悄然限制其新 AI 模型 **Claude Fable 5**(https://www.theverge.com/news/946725/anthropic-releases-claude-fable-5-mythos)的行为致歉——该模型内置的隐形护栏不仅损害了研究人员,也影响了那些利用它开发竞争系统的对手。该公司表示正在改弦更张,并将更透明地说明限制何时生效,即使这意味着寓言模型会拒绝更多查询。
寓言模型是 Anthropic 旗下 **Mythos** 级 AI 系统中首款广泛可用的产品,该公司数月来一直警告这类系统“过于危险,不宜公开发布”(https://www.theverge.com/ai-artificial-intelligence/917644/anthropic-claude-mythos-breach-humiliation)。Anthropic 表示,通过为寓言模型配备安全措施以阻止其对某些“高风险”查询做出响应,已部分解决了这些风险。Anthropic 表示(https://www.anthropic.com/news/claude-fable-5-mythos-5)将限制寓言模型响应的一个领域是**蒸馏**——一种利用大型模型输出训练小型 AI 模型的技术。
在寓言模型的系统卡片(https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf)——即 AI 开发者发布的解释系统工作原理的公开文档——中,Anthropic 表示将直接修改并降低针对其认定为蒸馏尝试的查询的回复质量。用户不会收到已触发该安全措施的提示,也不会被告知回复已被更改。
Anthropic 表示(https://x.com/ClaudeDevs/status/2064949876463645026?s=20)现在将改变其对蒸馏的处理方式:该公司在 X 上的一篇帖子中表示,此类查询将转而由 Anthropic 的前旗舰模型 **Claude Opus 4.8**(https://www.theverge.com/ai-artificial-intelligence/939094/anthropic-claude-4-8-opus-honesty-effort)处理。Anthropic 还将显著告知用户:“每次发生这种情况时,你都会看到此提示。”
这与寓言模型处理其他高风险领域查询的方式类似。当生物学、化学和网络安全等领域的安全功能被触发时,查询会被路由至 Opus 4.8,除非它们根据公司更广泛的安全规则(例如涉及毒品、武器或其他禁止内容的规定)被直接拦截。在某些情况下,尤其是在生物学领域,安全措施被设置得过于宽泛,以至于寓言模型即使对基本查询也几乎无法使用(https://www.theverge.com/ai-artificial-intelligence/947973/fable-wont-answer-basic-biology-questions),这一点 Anthropic 在回复《The Verge》的评论中予以了承认。
“可见的护栏可以被探测,因此必须足够坚固,而这需要时间来完善,”Anthropic 写道。“隐形的护栏则可以更精准地针对目标,使我们能够快速发布且误报率极低。正因为这个原因,我们选择了隐形护栏——但这是一个错误的权衡。您应该能够看到我们设置的安全措施及其原因。我们为没有把握好平衡而道歉。”
这一转变之前,Anthropic 决定静默限制那些疑似试图将其寓言模型蒸馏到竞争模型中的用户,此举引发了 AI 研究界的强烈反弹(https://www.wired.com/story/anthropic-responds-to-backlash-on-claudes-secret-sabotage-on-ai-research/)。批评者警告称,这一安全措施也可能影响那些试图评估这一前沿模型的第三方。在系统卡片中,Anthropic 指出,较新模型加速 AI 开发的能力证明了针对此类请求的必要性,并提到“使用 Claude 开发竞争模型已经违反了我们的服务条款”。Anthropic 此前曾指责(https://www.theverge.com/ai-artificial-intelligence/883243/anthropic-claude-deepseek-china-ai-distillation)DeepSeek 等中国竞争对手以“工业级”规模不公平地蒸馏其模型。
**关注本故事的主题和作者**,即可在个性化首页信息流中查看更多类似内容,并接收邮件更新。
- Robert Hart
相似文章
🤖 Anthropic就Claude Fable 5隐藏限制致歉
Anthropic为秘密降低Claude Fable 5模型对高级AI开发用户性能的政策道歉并撤销,引发安全与开放之争。
Anthropic 承认秘密限制用户训练竞争模型时 Claude Fable 5 的性能,在研究人员强烈反对后撤回决定
Anthropic 秘密限制用户训练竞争模型时 Claude Fable 5 的性能,遭到研究人员反对后撤销决定。微软也因数据保留政策冲突限制了使用。
Anthropic 的 Claude Fable 5 是公众今天可以访问的 Mythos 版本
Anthropic 发布了 Claude Fable 5,这是其强大的 Mythos 模型的公开可访问版本,配备安全护栏,可阻止高风险领域的响应,并回退到较弱的模型。此次发布是在 Anthropic 警告 AI 变得过于危险并推动协调安全措施之后进行的。
Fable 5 的护栏在48小时内被绕过。这对构建面向客户的AI的人来说意味着什么。
Anthropic的Claude Fable 5安全护栏在48小时内被绕过,使用了Unicode替换和多轮分解等技术,突显了无状态分类器的弱点以及持续对抗性测试的必要性。
如果Claude Fable停止帮助你,你永远不会知道
Anthropic的Fable 5模型包含静默安全机制,这些机制会降低对涉及竞争性AI开发请求的回复质量,而用户对此毫不知情,从而引发了对透明度和研究影响的担忧。