Fable 5 的“安全笼”做了大量公关工作,却无人提及
摘要
Anthropic 发布了其最强大的模型 Fable 5,采用了一个由分类器构成的“安全笼”,将危险查询重定向到旧模型,而非让模型本身变得安全,同时还对所有流量强制实施 30 天数据保留,包括企业零保留协议。
Anthropic 上周公开警告说,前沿 AI 已经变得足够危险,需要行业协调放缓。三天后,他们推出了 Fable 5 —— 用他们自己的话说:这是他们向公众发布过的最强大的模型。诀窍在于:Fable 5 和受限的 Mythos 5 是同一个模型。唯一的区别是前面的分类器会静默地将“危险”查询重定向到旧模型。模型本身并不安全——安全的是笼子。而正是这个笼子让他们得以销售它。哦,为了发布它,他们对所有流量实施了 30 天数据保留,包括那些有零保留协议的企业。你的隐私保障被降级了,这样发布才能进行。还有 IPO 即将到来。也许这个笼子真的有效——在 1000 多小时的对抗测试中没有出现通用的越狱方法,这确实令人印象深刻。但“危险到不能放缓,安全到可以销售”这真是一根难穿的针。是我太愤世嫉俗了,还是安全故事在发布说明中站不住脚?
相似文章
Fable 5 的真正故事在于数据保留条款
Anthropic 的 Claude Fable 5 版本之所以引人注目,不仅在于其能力,还在于其受控访问、数据保留策略和基础设施要求,这标志着向受控前沿 AI 部署的转变。
Fable 5 的护栏在48小时内被绕过。这对构建面向客户的AI的人来说意味着什么。
Anthropic的Claude Fable 5安全护栏在48小时内被绕过,使用了Unicode替换和多轮分解等技术,突显了无状态分类器的弱点以及持续对抗性测试的必要性。
我用了半天的Fable 5,发现护栏才是真正的故事
Anthropic的Fable 5模型展现了令人印象深刻的推理和上下文处理能力,但存在高延迟、高成本以及在特定领域静默回退到Opus 4.8的问题,这可能会中断工作流程。
Claude Fable 5 及新的AI安全寓言(14分钟阅读)
Anthropic 发布了 Claude Fable 5,这是一款重大新模型,在各项基准测试中显示出显著的能力提升,并引入了新的安全措施,标志着AI发展的一个关键时刻。
@levie: 事情似乎正在朝着更好的方向发展,Fable 和接下来的 GPT-5.6 可能也是如此。我们现在所拥有的是初步的…
讨论了前沿AI模型安全审查流程的演变,提到了Claude Fable 5的重新发布,以及需要建立一个共享的行业框架来评估越狱攻击,同时对安全与创新之间的平衡表达了谨慎乐观。