三个实验室的计划与备忘录(22分钟阅读)
摘要
文章分析了近期AI政策动态,包括白宫关于AI使用的备忘录、OpenAI的AGI安全计划以及Claude Fable 5的发布,同时对比了Anthropic和OpenAI的哲学理念。
这篇文章总结了围绕Anthropic的Fable公告而产生的几个与AI政策和计划相关的故事。
查看缓存全文
缓存时间: 2026/06/11 00:12
# 三个实验室的一项计划和一份备忘录
来源:https://thezvi.substack.com/p/three-labs-with-a-plan-and-a-memorandum
今天的大新闻是**Claude Fable 5 的发布(https://www.anthropic.com/news/claude-fable-5-mythos-5)**,这是 Anthropic 认为可以安全分发给大众的 Claude Mythos 版本。你绝对应该转到那个模型并试用它。但一如既往,这个博客不会急于评论新模型,直到我们花几天时间把玩它,看看我们的新宝贝能(和不能)做什么。这次也不例外,关于 Fable 的详细报道将于周五或周一开始。
今天我要带给你几个围绕 AI 政策和计划的关联故事,这些故事在 Fable 发布之前就出现了。
首先是政府给我们的一份 AI 备忘录,我将其解读为试图在法律上实施“Anthropic 永久被解雇,我们将随心所欲地使用任何模型,无论发生什么”,同时附带一些良好的治理和扩散计划。
其次,OpenAI 提出了一个计划,旨在确保 AGI 惠及所有人。其中包括强烈呼吁关键参与者之间进行国际协调,以确保有能力以安全为名减缓 AI 发展。这呼应了 Anthropic 和 Google DeepMind 的 Demis Hassabis 此前提出的相同呼吁。为可能的协调放缓做准备的想法得到了广泛支持。
OpenAI 提案的其余部分则关注相反的问题——权力集中,并将其论述集中在那个危险和 AI 的承诺上。注意,该文件只使用“灾难性”风险,而非存在性风险或灭绝,并且它没有认真考虑将控制权保留在人类手中的必要性,只担心错误的人类会指挥这些 AI。而 OpenAI 的计划,非常明确地,是让 AI 进入递归自我改进。
我欣赏这种坦诚,但内在的矛盾依然存在,且未被解决,甚至解决失败这件事本身也未被解决,如此循环。
这引出了 Joshua Achiam 在 Twitter 上关于 OpenAI 和 Anthropic 之间哲学差异的论断,Anthropic 员工报告说他错误地分类了他们的观点,但他提出了一个方向性的观点。
[](https://substackcdn.com/image/fetch/$s_!lD0m!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F9b994caf-2ae3-49a7-87f0-83b1bf13de33_1360x743.png)
这份文件名为《国家安全总统备忘录/NSPM-11》(https://www.whitehouse.gov/presidential-actions/2026/06/national-security-presidential-memorandum-nspm-11/)。
这似乎是一个结合体(https://x.com/mkratsios47/status/2062965784406892823):包括对 Anthropic 的实际禁令(含分包商)以及可能的一年代理期,允许所有(合法?)使用的声明,以及一些良好治理指令,包括采用来自多个供应商的技术。
像往常一样,第一节阐述了原则。
> 特朗普总统(https://www.whitehouse.gov/presidential-actions/2026/06/national-security-presidential-memorandum-nspm-11/):在我的政府领导下,美国能够且将以符合美国价值观的方式,负责任地加速在情报和作战领域使用 AI。……并对这些工具在最关键时刻可用充满信心。
第二节提出了四大支柱:采用、适应、保障和问责。
采用和适应无疑是好的。
问责是好的。但问题在于否定之否定。AI 的使用必须符合宪法、合法且经授权,负责人对此负责。很好。但正如我们多次讨论过的,国家安全机构认为合法的事情,甚至他们的法院会认定为合法的事情,范围相当广泛。有约束,但约束并不多,因此结合保障措施,你可以确信他们会做几乎所有他们想做的事。
保障是值得关注的一点。
> 国家安全企业应确保所有采用的 AI 技术都设计为可靠、稳健、可引导和可控,并且它们按照适用法律、政府政策和指南运行。为保护美国作战人员,国家安全企业应通过合同条款或其他方式,确保任何商业实体或对手不得在未经联邦政府知晓和批准的情况下,阻止使用、禁用、降级或实质上修改我们男女军人完成使命所依赖的 AI 系统。此外,应实施严格的安全和功能措施,包括测试、评估、验证和核查,以确保 AI 系统在整个国家安全企业中的适当保密性、完整性、可靠性、可用性和互操作性。
第一段和第三段应无争议,尽管没有实施措施就只是空谈。问题出在第二段:未经知晓和批准,其他实体不得“阻止使用、禁用、降级或实质修改”任何“我们男女军人所依赖的” AI 系统,这可能被解释为包括广泛系统,甚至民用系统。
也就是说,一旦你把模型交给我们,我们可以随心所欲地对它做任何事,而你对此无能为力。如果政府决定无视你的服务条款,你的合同将没有可执行的机制。
如果我们没有 DoW-Anthropic 对抗的历史,我们或许可以善意地解释为操作安全。但鉴于那次相遇,这显然就是“所有合法使用”减去“合法”二字。
就是“所有使用”。更干脆。
好消息是第 3 节允许他们直接发布豁免并忽略这一点,并可无限期重复豁免,这似乎相当可能发生。
第 3 节要求更新 DoD 指令 3000.09,并每年更新一次,以防他们在 OpenAI 交易中对遵循该指令的承诺妨碍任何事情。
然后他们几乎明说“我们再也不会在 DoW 使用 Anthropic”,如果你曾试图告诉我们不能做任何我们想做的事,那就滚吧。不,我们的承包商也不能用 Anthropic。
> 根据 2014 年《联邦信息安全现代化法案》(44 U.S.C. 3551 及以下)中概述的职责与责任,战争部长(针对该法案第 3553(e)(2) 条所述系统)、国家情报总监(DNI,针对第 3553(e)(3) 条所述系统)以及相关机构负责人(针对第 3557 条所述系统)应在法律允许的最大范围内,指示终止与那些反复表现出与本备忘录第 2 节所述政策不一致行为模式的公司的合同(包括因违约或便利的终止)。这包括这些公司作为分包商向适用机构提供服务的合同。这些机构的负责人可建立豁免程序,授予限定时间的有限例外,不超过一年,前提是此类关系对于负责任地管理美国国家安全是必要的。例外情况可能包括作战任务、测试与评估安排、威胁情报共享以及其他关键任务应用,但须采取适当的风险缓解措施和加强监督。
不过,你知道,现在这些公司之一可以破解地球上的任何东西,所以也许我们要稍微推迟那个命令。作为一个小奖励。但一年后,NSA 将完全停止使用 Claude,除非一年后我们因为某些原因再发布另一个豁免。
第 4 节要求从他们愿意使用的供应商那里引入最先进的模型,帮助 AI 公司以各种形式进行安全,并分析外国 AI 技术。
第 5 节是帮助解决招聘和培训的障碍,优先考虑研发,进行测试和验证等等。当然。
第 6 节是定义,第 7 节是标准条款。就是这些。
> Dean W. Ball(https://x.com/deanwball/status/2063035808437977443):这看起来是一份相当明智的政策文件。祝贺所有参与方!Divyansh Kaushik(https://x.com/dkaushik96/status/2062972978522992766):政府在这份 NSPM 上做得很好。里面有很多好东西。
Neil Chilson 似乎也满意(https://x.com/neil_chilson/status/2062977884390601182)。
Vinh Nguyen 和 Michael Horowitz 在 CFR 的分析(https://www.cfr.org/articles/what-trumps-national-security-ai-memo-gets-right-and-leaves-unresolved)将其描绘为高度合理且经过深思熟虑的政策,是对政府需要对其 AI 系统达到这种信任水平的回应,并且尽管批评了拜登的 NSM-25,但与之具有连续性。他们多次使用“非法国内监控”一词,仿佛忘记了这与“大规模国内监控”完全不同,并且非常认真地对待问责部分。他们似乎没有看到政府立场造成的问题,除了与国会失去信任。
Charlie Bullock 认为这基本没问题,但注意到它进一步削弱了针对 Anthropic 的论证(https://x.com/CharlieBull0ck/status/2062990417180696928),因为它实施了“直接解雇 Anthropic”这个明显的解决方案。
我同意他们在实施“尊重我的权威,去你的 Anthropic”以及良好政府事务方面做得很好。
我不认为完全采用第一部分是明智的,但他们不同意。如果你把那个当作前提,那么是的,我想各方面都做得不错。
战争部包括 NSA。
> Dean W. Ball(https://x.com/deanwball/status/2062628379225137508):供应链风险 Demetri(https://x.com/AsiaLens/status/2062609713489936708):独家新闻:#NSA 正在使用 #Mythos 进行进攻性网络行动。Anthropic 工程师被嵌入美国情报机构。Cristina Criddle(https://x.com/CristinaCriddle/status/2062609763276320792):独家:Anthropic 已在美国国家安全局部署了前向部署工程师,以帮助部署 Claude Mythos 进行网络进攻行动,与 @AsiaLens 合作
是的,NSA 正在使用 Mythos 进行进攻性网络行动,因为它是 NSA。
> dave kasten(https://x.com/David_Kasten/status/2062617827912085662):有趣的是确认了,尽管我基本假设这正在发生。
OpenAI 提出了其确保 AGI 惠及所有人的计划(https://openai.com/index/built-to-benefit-everyone-our-plan/)。
其中包括一个非常受欢迎的声明,呼吁建立国际组织,以便能够以灾难性风险为名减缓前沿 AI 发展,尽管他们不敢说“存在性”或“灭绝”。
这份文件是一个奇怪的混合体。它既认真又不认真地对待智能,对于权力集中以及逐渐剥夺权力也是如此。我不确定这个计划背后的思考是什么。
他们承诺“构建服务于人类的 AI”以及“广泛赋权人民”,并确保权力广泛分布。
> Sam Altman 和 Jakub Pachocki(https://openai.com/index/built-to-benefit-everyone-our-plan/):完全自动化一切并不是我们想要的未来。这将是令人不满的,而且是危险的。AI 应该帮助人们追求他们的目标,而不是脱离这些目标。随着 AI 系统变得更有能力,人类的角色变得更加重要:设定方向、做出权衡、运用判断力,并将价值观、品味、关怀和责任带入工作。人类的一个关键长期角色将是决定什么值得去做。
我的意思是,看,这是两种不错的情绪,但你知道你必须二选一,对吧?
比如说,如果你将 AI 分发给所有人,帮助他们追求目标?那么他们就会用它来自动化一切,并将行动交由 AI 处理。他们会让他们自己的 AI 决定什么值得做,然后 AI 们相互竞争。所以要么你可以限制他们拥有或使用它的能力,要么你可以不限制。
他们确实理解“RSI 很危险”这个问题,至少有一点:
> Sam Altman 和 Jakub Pachocki(https://openai.com/index/built-to-benefit-everyone-our-plan/):我们相信,在接下来的几年内,AI 进行 AI 研究将成为决定进步速度的因素。这很重要,因为对齐本身就是一个困难的研究问题。为了取得快速深入的进展,我们的研究人员将需要能够帮助测试想法、发现错误、探索替代方案并与之并行的 AI 系统。但更快的技术进步使人类判断和公共协调变得更加重要,而不是更少。未来应该由人、机构和社会塑造,而不是仅仅由构建最强大系统的公司来塑造。
这反复混淆了“是什么”和“应该是什么”。是的,未来“应该”由人类塑造,理想情况下是广泛的人类。你是如何促成这一点的?
领先 AI 努力的国际协调,以推进安全并允许协调行动,包括减缓。
哦。是的,这实际上是一个很好的回答起点。
> Sam Altman 和 Jakub Pachocki(https://openai.com/index/built-to-benefit-everyone-our-plan/):随着前沿 AI 开发的继续,我们预计国家和全球协调将变得更加重要。我们长期以来一直认为,最终应该有一个国际组织来帮助协调领先的 AI 努力,以减少灾难性风险。合作和共享安全标准是前进道路上的重要组成部分,特别是因为商业和国家竞争的激励很难摆脱。这样一个组织的一个目标应该是使世界能够采取协调行动,包括在需要时减缓前沿发展,以便社会韧性、安全和对齐能够跟上步伐。
如果你一直相信这一点,那么更早这样直白地说出来会很好,但我会欣然接受现在的声明。
好了,进入实际计划。
> Sam Altman 和 Jakub Pachocki(https://openai.com/index/built-to-benefit-everyone-our-plan/):**构建一个自动化的 AI 研究员**——一个能够加速并日益自动化研究过程本身的 AI 系统,同时保持可引导、可问责并与人类相连。我们内部的信念是,到 2028 年 3 月,我们可能有一大部分研究是由 AI 系统与我们的研究人员协同完成的。为了在对齐方面取得足够进展,我们相信需要 AI 与我们并行迭代。这将帮助我们导航到后 AGI 世界的过渡,以便我们共同决定通向未来的道路。**加速经济**,通过加速科学进步、生产力和经济增长,同时努力确保收益广泛共享。每个人都应有平等的分享 AI 创造的繁荣的机会。**给地球上的每个人一个个人 AGI**,赋予他们以自己选择的方式受益于人类最具变革性技术之一的能力。
所以计划是:
1. 递归自我改进。
2. 利用这一点实现富足并广泛分配收益。
3. 给每个人一个 AGI。
我注意到“给每个人一个 AGI”出现在 RSI 之后。大概他们得到的 AGI 将是家用玩具版,而不是工业级超级...
相似文章
AI 新闻:Anthropic 泄露揭示 AI 未来
泄露的 Claude Code 仓库曝光 Anthropic 的自主“恶魔模式”智能体与三层记忆系统,同时 OpenAI 完成创纪录的 1220 亿美元融资,微软发布 MAI-Transcribe-1。
Oracle与公司(5分钟阅读)
本文比较了OpenAI的Codex(GPT-5.5)和Anthropic的Claude(Fable 5)在上下文管理上的不同方法,对比了压缩(Oracle式)与子代理拆分(Firm式)策略在AI系统中的应用。
为 AGI 及其未来做好准备
OpenAI 阐述了为 AGI 做准备的战略,强调通过真实世界反馈循环进行渐进式部署,随着系统接近 AGI 能力而提高谨慎程度,以及开发更好的对齐技术以确保 AI 系统保持可控和安全。
关于AI开发的公开信
西蒙·威利森总结了近期AI开发领域的公开信,包括微软支持开放权重模型的信件、Anthropic的反对立场,以及前沿AI员工敦促稳步推进AI发展的信件。
智能时代的产业政策
OpenAI 发布了一系列以人为本的智能时代政策思路,提出了扩大机会、确保先进 AI 惠及所有人的框架,并附带奖学金计划和华盛顿特区研讨会。