网络安全研究人员不满Anthropic的Fable模型的护栏
摘要
Anthropic发布了其Fable模型,这是专注于网络安全的Mythos模型的受限版本,但网络安全研究人员批评其过于严格的护栏,甚至阻止了无害的任务。
网络安全研究人员抱怨Anthropic的新模型Fable的护栏过于严格,无法用于任何网络安全工作。
查看缓存全文
缓存时间: 2026/06/10 17:45
# 网络安全研究人员对Anthropic的Fable模型安全护栏表示不满 | TechCrunch
来源:https://techcrunch.com/2026/06/10/cybersecurity-researchers-arent-happy-about-the-guardrails-on-anthropics-fable/
Anthropic 于周二发布了其最新模型 Fable([链接](https://techcrunch.com/2026/06/09/anthropics-claude-fable-5-is-a-version-of-mythos-the-public-can-access-today/)),将其定位为强大且备受关注的网络安全模型 Mythos 的一个公开且受限版本。
然而,并非所有人都对这项限制感到满意。不少[网络安全](https://x.com/Behi_Sec)[研究人员](https://x.com/zeroxjf/status/2064400152178389307)[和](https://x.com/alexjplaskett/status/2064594731137409128)[专业人士](https://x.com/mehulmpt/status/2064449391969374238)在网上表达了[不满](https://www.reddit.com/r/ClaudeCode/comments/1u1rvn3/fable_refusing_every_request_related_to/)[意见](https://www.reddit.com/r/ClaudeAI/comments/1u1o50u/had_fable_5_run_an_indepth_cybersecurity_audit_of/)。
“Fable 会拒绝任何可能与网络安全有间接关联的请求,即使是像阅读一篇博客文章这样无害的任务。”在 IBM X-Force 工作的知名安全研究员 Valentina “Chompie” Palmiotti [表示](https://x.com/chompie1337/status/2064431038554939507)。
当某个提示词触发了其安全护栏时,Fable 会暂停对话并提示:“我们的安全措施因网络安全或生物学主题而标记了此消息。”
设置这些安全护栏是为了降低 Fable 被用于开发恶意软件或破坏软件的风险——这是 Anthropic [长期以来的担忧](https://www.anthropic.com/news/AI-enabled-cyber-threats-mitre-attack)。对生物学的限制则源于对[开发生物武器](https://red.anthropic.com/2025/biorisk/)的类似担忧。
当这家 AI 巨头在四月发布 Mythos([链接](https://techcrunch.com/2026/04/07/anthropic-mythos-ai-model-preview-security/))时,它将该模型限制在少数公司和组织范围内,并通过“Project Glasswing”([链接](https://techcrunch.com/2026/04/09/is-anthropic-limiting-the-release-of-mythos-to-protect-the-internet-or-anthropic/))计划部署该模型,以保护关键软件和基础设施。上周,Anthropic 将 Mythos 的访问权限[扩展](https://techcrunch.com/2026/06/02/anthropic-scales-claude-mythos-to-critical-infrastructure-in-15-countries/?_thumbnail_id=3114152)至 15 个国家的数百家组织。
然而,尽管初衷良好,许多网络安全专家仍然对限制措施的随意性感到不满。资深网络安全专家 Matt Suiche 告诉 TechCrunch:“如果你要求它编写安全代码,它会将其视为与网络安全相关的工作而非软件工程最佳实践,然后你的请求就会被降级处理。” Fable 在触发安全护栏时会被设置成回退到 Claude Opus 4.8。“这似乎是基于关键词的,所以任何与‘网络安全’词汇域相关的内容都会触发安全护栏。”
#### 联系我们
你是否有更多关于黑客如何使用 AI 的信息?或者网络安全公司如何利用 AI?我们很乐意听取你的意见。请使用非工作设备和网络,通过 Signal 联系 Lorenzo Franceschi-Bicchierai(号码 +1 917 257 1382),或通过 Telegram 和 Keybase @lorenzofb,也可以[发送邮件](mailto:[email protected]/)[。](mailto:[email protected]/)
“但这是可以理解的,毕竟我们还处于早期阶段,他们仍在调整自己的安全护栏。我相信它们会随着时间推移而演变,Anthropic 和其他前沿模型公司将与当前新一批网络安全公司更多合作。”Suiche 说道,他是 AI 网络安全初创公司 Tolmo 的技术人员。“在这样的发布中,宁可多拦截一些人,也不要拦截不足,然后再逐步放宽安全护栏。”
另一位研究员在 X 上[抱怨](https://x.com/evilsocket/status/2064694653765451925)说,“即使是请求代码审查”也会触发 Fable 的安全护栏。
Anthropic 并未立即回应置评请求。
除了模型内部的安全护栏外,Anthropic 还要求网络安全专业人士申请[网络安全验证计划](https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude#:~:text=Program%20described%20below.-,Cyber%20Verification%20Program,-Many%20cybersecurity%20practitioners)。如果获得批准,申请者在将 Claude 用于网络安全工作时受到的限制会更少。OpenAI 也有一个类似的计划,名为[网络安全信任访问](https://chatgpt.com/cyber)。
*通过我们文章中的链接购买商品,我们可能会获得少量佣金([链接](https://techcrunch.com/techcrunch-affiliate-monetization-standards/))。这不会影响我们的编辑独立性。*
Lorenzo Franceschi-Bicchierai 是 TechCrunch 的高级撰稿人,负责报道黑客攻击、网络安全、监控和隐私领域。
您可以通过电子邮件 [[email protected]](mailto:[email protected]) 联系或验证 Lorenzo 的来信,也可以通过 Signal 加密消息(+1 917 257 1382)以及 Keybase/Telegram @lorenzofb 联系。
查看简历([链接](https://techcrunch.com/author/lorenzo-franceschi-bicchierai/))。
相似文章
AI护栏如何阻碍进攻性网络安全研究人员的工作
旨在防止恶意使用的AI安全护栏,同时也阻碍了合法的进攻性网络安全研究人员,他们需要不受限制的模型访问权限来识别和利用漏洞以进行防御。研究人员批评了像Anthropic和OpenAI这样的AI公司所实施的任意把关行为。
美国禁止Anthropic发布Fable 5,但数字似乎并不在意
美国政府以国家安全为由,强制Anthropic撤下其最新AI模型Fable 5和Mythos 5,此前有报道称发生了越狱事件。此举引发争议,网络安全研究人员签署公开信,称其危险。
Anthropic 称这些话题太危险,不让其 Fable 5 模型谈论
Anthropic 发布了 Claude Fable 5,这是其最新的人工智能模型,具有严格的基于话题的安全措施,防止它回答关于网络安全、生物学和化学等危险主题的查询;该模型可能会偶尔拒绝无害请求,但旨在防止恶意使用。
联邦政府因简单“修复此代码”提示对Fable 5感到恐慌,而非越狱
美国政府因研究人员使用简单的“修复此代码”提示而封锁了Anthropic的Fable 5和Mythos模型,但安全专家Katie Moussouris认为这并非越狱,并指出出口管制损害了网络安全防御者。
网络安全资深人士抗议美国政府对Anthropic最强模型实施的‘危险’禁令
包括行业资深人士在内的76位网络安全专家发表公开信,抗议美国政府针对Anthropic最强大AI模型Fable和Mythos的出口管制令,认为限制防御者获取这些模型是危险的,因为对手正在进步。Anthropic在命令下达后全球暂停了访问。