Anthropic的安全超能力
摘要
Anthropic发布了Fable,声称其前身Mythos过于危险,但随后发现了一个越狱漏洞,促使美国政府发布出口管制指令,暂停访问。文章分析了该公司与政府之间因国家安全担忧而产生的冲突。
暂无内容
查看缓存全文
缓存时间: 2026/06/15 11:57
# Anthropic 的安全超能力
来源:https://stratechery.com/2026/anthropics-safety-superpower/
我对那些始终将Anthropic的公开声明(尤其是围绕其模型发布的声明)描述为营销目的的危言耸听的怀疑论者表示理解。就在两个月前,Anthropic宣布了Mythos Preview,称该模型因具备先进网络安全能力而过于危险,无法公开发布。随后,两个月后,该公司公开发布了Fable,这是Mythos的一个附带各种安全护栏的版本。
根据我的有限体验,Fable是一款令人印象非常深刻的模型。除了编码性能外,客观评价模型越来越困难,但主观感受是存在的——我发现与Fable的交互极为出色;它让其他模型(包括GPT 5.5和Opus 4.8)显得既小又笨。我此前有过两次类似感受,分别是GPT-4和Grok 4,这两者都代表了基础模型规模和复杂性的新一代;我的感觉是,Fable源自一次新的预训练,是新一代模型中的第一款。
为此,我当然可以接受Fable/Mythos在识别和利用安全漏洞方面确实更强大,并且Anthropic的谨慎发布是有道理的。然而,公开发布模型的问题在于,护栏可能被越狱,而显然这正是发布后不久发生的情况。
### Anthropic 再次对阵美国政府
接下来发生的事情有些模糊不清。Anthropic在一篇博客文章中写道(https://www.anthropic.com/news/fable-mythos-access):
> 美国政府以国家安全权力为由,发布了一项出口管制指令,要求暂停所有外国公民(无论在美国境内还是境外,包括外籍Anthropic员工)对Fable 5和Mythos 5的访问权限。这项指令的实际效果是,我们必须立即对所有客户禁用Fable 5和Mythos 5以确保合规。所有其他Anthropic模型的访问不受影响。我们于今日美国东部时间下午5:21收到政府的指令。信中未提供其国家安全关切的具体细节。我们的理解是,政府认为其已获悉一种绕过(即“越狱”)Fable 5的方法。我们审查了该特定技术的演示,该演示被用于识别少量此前已知的微小漏洞。这些漏洞看起来都相对简单,我们发现其他公开可用的模型无需绕过就能发现它们。
Anthropic接着辩称,非通用越狱是不可避免且范围狭窄的,并且没有证据表明存在通用越狱;与此同时,发现的越狱似乎是由亚马逊报告的(https://www.theinformation.com/articles/amazons-jassy-raised-concerns-anthropic-model-trump-crackdown?rc=gtxu6q),这值得注意,因为亚马逊既是Anthropic的投资者,也是该公司的主要推理提供商。在我撰写本文时,Anthropic资深员工正在华盛顿特区(https://www.axios.com/2026/06/14/anthropic-white-house-mythos-fable)寻求解决他们坚称是误解的问题,而白宫官员则暗示该公司领导层对合理的国家安全关切漠不关心。
鉴于许多事实存在争议,我对当前的冲突其实没有太多补充;我不感到惊讶的是冲突正在发生:我已在《Anthropic与对齐》中解释了(https://stratechery.com/2026/anthropic-and-alignment/)美国政府与Anthropic之间的冲突为何不可避免。为此,那些认为Mythos不够强大、不值得政府采取如此激烈行动的人,忽略了一个要点:如果现在不够强大,那么下一个就会足够强大,或者再下一个,尤其是在模型越来越擅长创造自己的后继者的情况下。
然而,这引出了另一个问题——似乎证实了怀疑论者的观点:如果Mythos如此危险,为何还要首先发布Fable,又为何要与正在做你声称想做的事情的政府对抗?事实上,我认为Anthropic的行为相当可以理解;这家公司的独特之处在于其如何论证这些行为的合理性,而正是这些论证既为怀疑论者提供了燃料,也为Anthropic赋予了魔力。
### 经济驱动力
在AI发展的最初几年,最大经济价值流向了算力,原因显而易见:我们的供应无法满足需求,这导致价格飙升;最大的受益者是Nvidia、台积电以及内存制造商(SK hynix、三星和美光)。与此同时,Anthropic和OpenAI在构建前沿模型上合计亏损了数百亿美元,而这些模型一旦发布,就会被开源模型(主要来自中国)提炼并商品化。
这代表了实验室的悲观情景——它们永远无法收回成本,因为它们的差异化转瞬即逝,而免费替代品变得“足够好”——我认为这是一个合理的观点。模型可互换的世界就是一个模型商品化的世界,而大部分价值流向其他地方。目前这是算力,但假以时日,当我们拥有足够算力时,价值链中最有价值的位置将是历来最值钱的位置:拥有用户接触点。
为此,我早就清楚前沿实验室在经济上有动力更靠近用户。如果你拥有用户接触点,你就有了有意义的锁定效应,而拥有用户接触点的最佳方式就是成为用户所需一切操作的画布。这进而意味着,前沿实验室与软件公司正走向冲突:是软件拥有用户接触点,而前沿实验室的长期利益不仅仅是成为软件的商品化输入,而是直接取代软件本身。
与此同时,软件公司正在反向努力。Satya Nadella在一篇X上的文章中阐述了他的愿景(https://x.com/satyanadella/status/2066182223213293753?s=46),说明公司应如何在模型之上构建:
> 每家公司都必须构建我所称的人力资本和代币资本。人力资本包括其员工的知识、判断力、关系、创造力和模式识别能力,而代币资本则是公司构建并拥有的AI能力。重要的是,随着代币资本的增长,人力资本并不会贬值——它只会变得更有价值!我相信人类能动性将成为代币资本增长的驱动力。人类将设定雄心勃勃的目标,跨领域连接点,建立关系,并识别最重要的模式。没有人类的指引,算力只会原地打转。这意味着真正的机会不在于挑选最好的模型,而在于在模型之上构建一个学习循环,使人力资本和代币资本得以复利。你可以外包一项任务,甚至一份工作,但你永远无法外包你的学习。公司的未来在于能够将这种学习在人机之间复利。这需要一种新的架构方法,使每家企业都能构建随时间改进的代理系统,同时保持对其知识产权的控制。公司应该能够更换“通才”模型,而不会丢失其学习系统中内嵌的“公司老手”专业知识。这是未来时代你掌控权和主权的关键“考验”。
Nadella以警告开头:
> 我们不希望看到这样的世界:每个行业的每家公司都将价值拱手让给少数几个吞噬一切的模型。如果所有价值只由少数模型累积,政治经济学根本不会容忍。没有社会许可让AI未来掏空整个行业。想想全球化第一阶段发生的事情,整个工业经济因外包而被掏空。表面上看GDP数字还算正常,但流离失所是真实的,后果至今仍在感受。让我们不要把这种动态带入AI时代——少数AI系统捕获所有经济回报,而整个行业的知识则从脚下被商品化。
这个类比的问题在于:全球化确实发生了,工业经济被掏空了。这有可能不是警告而是预言;难怪Nadella要拉响警报,因为微软可能就是受害者之一。同理,模型制造商的经济驱动力恰是要实现这一目标。
### 数据驱动力
模型——甚至不是Mythos——还远未达到这一阶段。除了更多算力,它们还需要更多更好的数据。模型改进越来越依赖于强化学习;其中一些可以由合成数据生成,但对于前沿实验室而言,最强大的杠杆是真实世界的使用。
我认为,这是OpenAI和Anthropic都提供高额补贴订阅计划的一个主要原因。SemiAnalysis最近估计(https://x.com/SemiAnalysis_/status/2064815044085318040),200美元的套餐可获得价值8000美元的Claude代币和14000美元的Codex代币。当然,两者都在争夺用户和开发者的心智份额,但它们也在争夺访问实际使用数据以改进模型的机会。
Anthropic借助Fable大幅加码,宣布他们将保留所有使用数据30天,甚至包括之前承诺零数据保留的企业计划。该公司表示不会在这些数据上训练,但没有设置任何保障措施来确保将来不会这样做(例如将数据存储于第三方)。如果这项政策变更(一旦Fable恢复)没有导致大量客户流失,我怀疑他们开始使用这些数据只是时间问题:这对他们的最终目标实在太有价值了。
还要注意向上游进入用户接触点的良性循环:使用Claude或Codex直接完成的工作流越多,每家公司获得的数据就越多,这些数据反馈回训练,使产品更加能干和有用,从而扩大它们能够服务的工作流范围,进而扩大数据获取。
Nadella在他的文章中强调了这些数据的重要性,但自然认为数据应独立于模型:
> 公司需要将其工作流、领域知识和积累的判断力转化为每次使用都会改进的AI系统。私有评估应捕捉模型是否在改进对业务重要的结果(而不仅仅是外部基准!)。私有强化学习环境应允许模型在组织内部的真实轨迹上变得更强。其知识库使机构记忆可查询,并使代币使用更高效。这个循环成为了公司新的知识产权。我将其视为一种爬山机器。而且与大多数资产不同,它会产生复利。每一个改进的工作流都会产生更好的训练信号,从而加速积累公司特有的隐性知识。早期构建这种系统的公司将获得难以复制的优势,无论任何新单个模型的能力如何。
然而,如果屈服于Anthropic数据政策的公司现在就能获得更好的结果呢?或者,如果现有公司抵制,从而为新公司——或模型制造商本身——在市场上击败它们敞开大门呢?Anthropic无疑正在考验Nadella所呼吁的决心。
### 权力驱动力
令人惊讶的是,围绕Fable/Mythos的数据保留政策甚至还不是此次发布中最具争议的部分。相反,Anthropic在发布时表示,如果Fable被用于LLM开发,它将无声地降低其性能。来自系统卡(https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf):
> 我们还添加了与前沿LLM开发相关的安全措施。正如我们在2026年2月风险报告(https://anthropic.com/feb-2026-risk-report)第6.1节中讨论的那样,我们担心加速整体AI开发速度的风险,尽管我们仍不确定这些风险的严重程度。具体来说,我们的担忧在于——正如我们当时所写的——“加速其他AI开发者构建与我们的模型构成类似风险、但未必具备相应安全措施的强大AI系统”。鉴于近期模型加速自身开发的能力(https://www.anthropic.com/institute/recursive-self-improvement),我们实施了新的干预措施,限制Claude在针对前沿LLM开发请求(例如,构建预训练流水线、分布式训练基础设施或ML加速器设计)上的有效性。使用Claude开发竞争模型已经违反了我们的服务条款(https://www.anthropic.com/legal/consumer-terms),但通过我们的安全措施执行这一限制,可以避免加速那些最愿意违反这些条款的参与者。与我们针对网络安全、生物学和化学以及蒸馏尝试的干预措施不同,这些安全措施将对用户不可见。Fable 5不会回退到不同的模型。相反,安全措施将通过与提示修改、转向向量或参数高效微调(PEFT)等方法限制有效性。这些干预措施不会影响绝大多数编码工作。我们估计它们将影响约0.03%的流量,集中在不到0.1%的组织中。当这些干预措施激活时,我们预计它们对模型的行为影响最小,除了限制其在前沿LLM开发方面的有效性。Claude仍将有益地响应用户的请求。我们将在此模型发布后继续提高检测方法的精确度。
Anthropic撤销了这一变更(https://www.wired.com/story/anthropic-responds-to-backlash-on-claudes-secret-sabotage-on-ai-research/)——Fable将简单地将LLM相关请求转交给Opus 4.8,并向用户披露此转交——但我认为最初的政策非常具有启示性。一方面,我实际上并不怨恨Anthropic不想帮助其竞争对手;另一方面,应该极其清楚的是,Anthropic认为除了他们自己之外,任何人都不应该制造前沿LLM。
使这项政策更加引人注目的是,它仅在Anthropic与战争部发生争端两个月后就实施了:后者希望Claude可用于任何合法用途,而前者则希望对监控和自主武器实施更严格的控制。这种性能降级代表了Anthropic既有能力也有意愿默默修改其模型以实现其政策偏好。换句话说,Anthropic有意地证实了其一些批评者关于其成为供应链风险的
相似文章
美国禁止Anthropic发布Fable 5,但数字似乎并不在意
美国政府以国家安全为由,强制Anthropic撤下其最新AI模型Fable 5和Mythos 5,此前有报道称发生了越狱事件。此举引发争议,网络安全研究人员签署公开信,称其危险。
美国政府禁止Anthropic是否在无意中帮助了该品牌?
美国政府发现越狱漏洞后,以国家安全为由强制Anthropic撤下其Fable 5和Mythos 5模型。本期TechCrunch的Equity播客探讨了该禁令是否可能无意中有利于Anthropic的品牌和IPO前景。
美国政府封禁Anthropic模型与AI越狱无关
美国政府发布出口管制指令,以国家安全为由强制Anthropic将其Fable 5和Mythos 5 AI模型下线。安全研究人员认为,所谓的护栏绕过并不足以证明此类行动的合理性,且此举损害了美国的网络防御能力。
美国政府指令暂停访问Fable 5和Mythos 5
美国政府以国家安全为由,发布了一项出口管制指令,要求暂停访问Anthropic的Fable 5和Mythos 5模型,原因是指出存在潜在的越狱方法。Anthropic正在遵守指令,禁用所有用户的访问权限,但对漏洞的严重性提出异议。
Anthropic 根据政府命令切断 Fable 5 和 Mythos 5 的访问
Anthropic 根据一项以国家安全为由的政府出口管制指令,切断了对其 Fable 5 和 Mythos 5 AI 模型的访问,阻止了所有外国公民甚至内部员工。该公司遵守了命令,但批评缺乏具体证据,称所谓的漏洞是次要的,并且在 GPT-5.5 等其他模型中同样存在。