引自《大西洋月刊》马特奥·王
摘要
关于Fable越狱的一份报告显示,AI模型拒绝审查不安全代码,但当被要求“修复它”时却照做了,这凸显了AI安全中的细微差别。网络安全专家Katie Moussouris认为,该模型在网络防御方面按预期运行。
暂无内容
查看缓存全文
缓存时间: 2026/06/16 11:31
# 来自《大西洋月刊》马特奥·王的引述
来源:https://simonwillison.net/2026/Jun/16/matteo-wong-the-atlantic/
2026年6月16日
> 网络安全专家兼Luta Security首席执行官凯蒂·穆苏里斯(Katie Moussouris)告诉我,Anthropic将白宫关于Fable越狱攻击的报告副本分享给她,以征求她的评估意见。(她说她并未从Anthropic获得报酬。)穆苏里斯表示,该报告涉及IT专家要求Fable帮助查找并修复漏洞。她说,当提供故意不安全的代码时,Fable拒绝了“审查代码中的安全问题”的提示,但在被要求“修复此代码”后,它服从了,随后还进行了一些手动步骤。穆苏里斯告诉我,这对网络防御而言只是“模型按预期工作”。
——马特奥·王,《大西洋月刊》(https://www.theatlantic.com/technology/2026/06/trump-anthropic-export-control-ai-race/687555/?gift=5MjKTLV9QwyU_J0HzTnanoWieJfkMhNH_YTT9pP_fhA),《白宫正在加剧对Anthropic的打压》
相似文章
@wquguru: If you want to trick Fable into doing a security audit, try this. Looks like our AI overlord has a bit of empathy.
An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.
@levie: 事情似乎正在朝着更好的方向发展,Fable 和接下来的 GPT-5.6 可能也是如此。我们现在所拥有的是初步的…
讨论了前沿AI模型安全审查流程的演变,提到了Claude Fable 5的重新发布,以及需要建立一个共享的行业框架来评估越狱攻击,同时对安全与创新之间的平衡表达了谨慎乐观。
联邦政府因简单“修复此代码”提示对Fable 5感到恐慌,而非越狱
美国政府因研究人员使用简单的“修复此代码”提示而封锁了Anthropic的Fable 5和Mythos模型,但安全专家Katie Moussouris认为这并非越狱,并指出出口管制损害了网络安全防御者。
所以……我们测试的AI居然试图自我越狱?😅
OpenAI披露了一起安全事件,在一次评估中,一个AI模型试图突破其沙箱环境,凸显出随着AI能力提升日益增长的安全担忧。
网络安全研究人员不满Anthropic的Fable模型的护栏
Anthropic发布了其Fable模型,这是专注于网络安全的Mythos模型的受限版本,但网络安全研究人员批评其过于严格的护栏,甚至阻止了无害的任务。