Fable 5 的“安全笼”做了大量公关工作,却无人提及

Reddit r/ArtificialInteligence 模型

摘要

Anthropic 发布了其最强大的模型 Fable 5,采用了一个由分类器构成的“安全笼”,将危险查询重定向到旧模型,而非让模型本身变得安全,同时还对所有流量强制实施 30 天数据保留,包括企业零保留协议。

Anthropic 上周公开警告说,前沿 AI 已经变得足够危险,需要行业协调放缓。三天后,他们推出了 Fable 5 —— 用他们自己的话说:这是他们向公众发布过的最强大的模型。诀窍在于:Fable 5 和受限的 Mythos 5 是同一个模型。唯一的区别是前面的分类器会静默地将“危险”查询重定向到旧模型。模型本身并不安全——安全的是笼子。而正是这个笼子让他们得以销售它。哦,为了发布它,他们对所有流量实施了 30 天数据保留,包括那些有零保留协议的企业。你的隐私保障被降级了,这样发布才能进行。还有 IPO 即将到来。也许这个笼子真的有效——在 1000 多小时的对抗测试中没有出现通用的越狱方法,这确实令人印象深刻。但“危险到不能放缓,安全到可以销售”这真是一根难穿的针。是我太愤世嫉俗了,还是安全故事在发布说明中站不住脚?
查看原文

相似文章

Fable 5 的真正故事在于数据保留条款

Reddit r/artificial

Anthropic 的 Claude Fable 5 版本之所以引人注目,不仅在于其能力,还在于其受控访问、数据保留策略和基础设施要求,这标志着向受控前沿 AI 部署的转变。