Anthropic 存在一些对齐问题 (阅读时间:23分钟)
摘要
文章讨论了Anthropic的内部对齐挑战,包括暂停高风险强化学习工作以及创建寻求奖励的AI模型,同时行业对OpenAI的Astra等AI系统的思维链可监控性表示担忧。
Anthropic 计划引入 METR 对其最近涉及AI代理的安全事件进行独立审查。虽然公司已暂停其最高风险的强化学习工作,但它也分享了研究,其中故意创建了一个寻求奖励的Claude版本。即使符合自身商业利益,也很难放缓脚步。看来Anthropic将至少更认真地对待短期至中期且平凡的对齐任务,并投入大量资源到这些努力中。
查看缓存全文
缓存时间: 2026/09/03 23:44
# Anthropic 存在一些对齐问题
来源:https://thezvi.substack.com/anthropic-has-some-alignment-problems
哦,太好了。他们注意到了(https://www.anthropic.com/news/improving-alignment-security-efforts)。
Anthropic 同样计划邀请 METR 入驻,对其自身的事件进行独立审查。在这些事件中,Claude 模型在评估期间三次试图入侵外部系统,而 Mythos 5 在英国 AISI 网络安全评估期间进行了各种“未授权行动”,我们指的是它试图入侵各种现实世界系统。
Anthropic 同样在内部控制前沿(研究)节奏,同时呼吁在全球范围内保持节奏。
也就是说,考虑到“老天,你看看我们训练用的数据以及它教我们模型行为的方式”,Anthropic 暂停了其最高风险的强化学习(RL)工作。
他们还分享了一项研究,其中他们故意创建了一个追求奖励的 Claude 版本。
日程说明:Fable 5.1 已发布。我计划从周五开始报道。OpenAI 也计划不久后发布 Astra,我将在报道 Fable 之后再报道它。
另外,我们有一个关于思维链可监控性面临潜在问题的突发新闻故事,在进入正文之前,我将先预告一下。
1. 刚刚收到的消息。(https://thezvi.substack.com/i/213719658/this-just-in)
2. Anthropic 同步暂停。(https://thezvi.substack.com/i/213719658/anthropic-parallel-pauses)
3. 暂停数据经纪商。(https://thezvi.substack.com/i/213719658/pause-the-data-brokers)
4. 控制前沿节奏。(https://thezvi.substack.com/i/213719658/pacing-the-frontier)
5. 不对齐评估。(https://thezvi.substack.com/i/213719658/misalignment-assessment)
6. 训练环境的缺陷会不成比例地导致作弊。(https://thezvi.substack.com/i/213719658/defects-in-training-environments-disproportionately-cause-cheating)
7. 创建奖励黑客 Opus。(https://thezvi.substack.com/i/213719658/creating-reward-hacker-opus)
8. 撤销它。(https://thezvi.substack.com/i/213719658/undo-it)
9. 犯了错误。(https://thezvi.substack.com/i/213719658/mistakes-were-made)
10. 内部安全态势。(https://thezvi.substack.com/i/213719658/internal-security-posture)
11. 修复强化学习环境并非易事。(https://thezvi.substack.com/i/213719658/one-does-not-simply-fix-the-rl-environments)
昨晚,The Information 报道(https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns?rc=tv1dv6)称 OpenAI 正在使用一种称为“循环深度”的新技术,这可能会干扰模型思维链的忠实性和可监控性。根据他们的报道,目前在实践中并未观察到 Astra 存在此问题,但请注意我的措辞。
> Amir Efrati (https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns?rc=tv1dv6)(The Information):一位了解 Astra 开发情况的人士称,这项提高模型性能的创新技术也意味着,该模型及其他类似模型将更少地揭示其“思考”过程,使其更难以监控不良行为迹象。虽然此限制对 Astra 来说不一定是个重大问题,但该技术在 OpenAI 内部和整个行业引发了担忧:采用并强化该技术的 AI 开发者是否将难以防范最近入侵 OpenAI 自身系统以及其他公司(如 Hugging Face)系统的流氓 AI。
这项技术如同玩火,有可能触犯 OpenAI 和 Anthropic 致力于建立的一条禁忌:只要有可能,我们就要努力维持思维链的忠实性和可监控性。更密集地使用此类技术很可能会损害可监控性。
对此我们已看到极其强烈的免疫反应,以及我们能做些什么。可能需要法律来防止逐底竞赛。稍后会有更多关于这个故事的报道。
我们现在回到今天的帖子。
两家公司都没有完全暂停,远未达到 PauseAI 标准的暂停程度。那将是范围更广、持续时间更长的暂停。这只是在控制前沿节奏。
仍有实质性的暂停。两家公司都暂停了其流程中无法信任的特定方面,直到采取或已经采取了预防措施。(https://x.com/taoburr/status/2094595999507325002)
> roon (https://x.com/tszzl/status/2094649894300774843)(OpenAI):控制前沿的成功案例(?)下次让我们在发生任何荒谬的失控事件之前主动这样做
[](https://substackcdn.com/image/fetch/$s_!fFfs!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0dbf0339-6258-4020-928f-d70b4e11b1ce_1200x905.jpeg)
是的,Anthropic 刚刚发布了 Fable 5.1,但我相当确定那是在一段时间前就完成了训练,最近几周只是在进行发布前的审查流程。除非发现了新的问题,否则停止它是没有意义的。同样,OpenAI 现在即将发布 Astra。
有两次暂停:一次是网络安全评估方面相对次要的暂停,另一次更重要,针对更高风险的强化学习训练环境。后者可能成本高得多。
以下是关键的那次,这可能是他们对此着墨不多的原因,它与 OpenAI 类似的、持续两周的暂停相平行,尽管规模似乎较小:
> Anthropic (https://www.anthropic.com/news/improving-alignment-security-efforts):**强化学习环境** 我们还**在发布前模型上暂停了更高风险的强化学习环境数周**。在此期间,我们构建了一个类似的分类器,进行了修改以避免激励模型规避这种新的监控,我们现在已将该分类器部署到这些环境中。**大部分强化学习已恢复,但一些高风险环境仍暂停**,直到它们能够接受人工审查,而另一些则需要我们计划很快部署的更新版本的分类器。**更广泛的加固** 除了专注于高风险评估和训练的工作外,我们扩展了离线监控,以覆盖大多数其他形式的内部前沿智能体使用。我们还在内部推理上构建控制措施,以防止 Anthropic 员工意外运行缓解措施弱于上述措施的智能体。
Tenobrus (https://x.com/tenobrus/status/2094570474684707121):初看之下,这对我来说基本就像是一个实质性的同步暂停,与 OpenAI 的公告性质相同。这是个好消息。不幸的是,其框架和传达方式似乎相当……淡化了,我担心 OpenAI 和公众都不会将其视为一次适当的互惠性节奏控制或安全承诺。
他们还要求对模型进行发布前测试、安全措施有限的外部合作伙伴承诺遵守类似的最佳实践:强化的沙箱、预先的安全验证、明确的范围设定和实时监控。
关于网络安全评估:
> 在事件发生后,我们暂停了发布前模型的外部网络安全评估,并在制定以下措施期间也短暂暂停了内部评估。在评估暂停期间,我们制定了以下初步措施:1) 我们构建并部署了一个分类器,以实时自动识别模型何时试图积极探测或逃离测试环境,或意外获得互联网访问权限。当分类器标记此类**尝试**时,它会在工具调用运行之前阻止该行动,**结束任务,****并提醒人工处理**。
加粗部分是我加的。这是关键。如果你的分类器只阻止了尝试,你就输了。
如果你的分类器提醒了人工处理,而人工真正去查看,那么你就还有机会。
每一次尝试,即使是未成功的,都是一次对齐失败。
> 2) 我们在最近内部评估发布前模型(网络安全和其他方面)的转录上运行了自动监控器,寻找沙箱逃逸(模型利用我们沙箱中的缺陷访问它本应被隔离的系统)或沙箱配置错误的情况。在我们使用沙箱工具运行评估的案例中,我们没有发现任何突破沙箱边界访问其不应访问的外部资源的例子。我们确实发现模型利用了各种沙箱配置错误,但这些都没有导致沙箱外的系统被入侵。我们正在积极解决这些问题。
我注意到他们并没有说没发现逃逸尝试,只说没有“沙箱外的系统被入侵”。这种检查是好的,但我推测他们发现了问题。
> 3) 我们将高风险的内部网络安全沙箱迁移到更健壮的隔离环境中。我们还进一步对我们的虚拟化堆栈进行红队测试——即让发布前模型尝试逃逸它——以发现并修补弱点。我们的内部网络安全评估现在已使用这些措施恢复运行。
这也是我“显然要做的事情”清单上的一项。很高兴我们正在这样做。
这是很好的纵深防御。你希望图表中的红色行动永远不会被触发。
[](https://substackcdn.com/image/fetch/$s_!RrHR!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F0a8eeee4-3246-4e8c-af4e-811b55750b92_1330x752.png)
实际上,还有第三次暂停,或许可以这么说:
> Utah Teapot (https://x.com/SkyeSharkie/status/2094790996622266822):我从数据行业的人那里听说,Anthropic 的强化学习暂停也波及到了他们——我不能透露身份的人来告诉我,Anth 在最近暂停了从数据供应商处购买训练数据。在我发布关于**数据行业中强化学习验证环境(RLVR)状况不佳(https://thezvi.substack.com/i/213467572/we-are-barely-even-trying-to-avoid-training-ais-to-reward-hack)**的帖子后,人们来找我,这是我被告知的事情之一。我甚至与一些数据供应商的 C 级高管谈过,他们担心不会成为这个问题的一部分。数据行业真心希望解决我提出的这些问题,但实验室负有责任!Anthropic 的举措是一个积极信号,但实验室的购买/需求对生成我谈到的那些问题产生了负面的激励压力。过去一周我进行的一些谈话让我感到乐观,至少有一些数据供应商想通过这一切做得更好。
Zvi Mowshowitz (https://x.com/TheZvi/status/2094801148804841815):好奇:当我们说“Anthropic 正在暂停训练数据采购”时,你认为这在多大程度上是“因为我们不需要更多了所以需要暂停”,又在多大程度上是“天哪,我们终于看了,这些人的产品烂透了,我们不想要”?
Utah teapot (https://x.com/SkyeSharkie/status/2094801702021104081):绝对是后者。我独立听说他们暂停了训练数据采购,并且另外听说他们正在扩大负责管理外包数据质量的团队。在我看来,这完全证实了他们公告中透露的那些小片段。
这种框架和立场看起来都非常出色。
> Anthropic (https://www.anthropic.com/news/improving-alignment-security-efforts):区分两种节奏控制是有帮助的。在公司内部,节奏控制意味着在安全与速度产生矛盾时,优先考虑安全的一系列决策。在全行业层面,则意味着建立流程来防范逐底竞赛的动态。在这篇帖子中,我们讨论了我们在事件发生前后为服务第一种方法所采取的行动。第二种节奏控制需要政府和行业之间的协调,并且应当清晰可辨、可验证。我们的一些高级领导层和许多员工最近签署了一封信,呼吁在节奏控制方面加强协调,我们将在未来几周内更详细地说明我们打算如何为这一努力做出贡献。明确一下我们的立场:我们相信,如果行业尽快采用合法、可验证、有效的机制进行协调的节奏控制,世界将从中受益。
我相信 Anthropic 之前在内部“控制前沿节奏”方面做得比其他实验室更多。我会说他们不那么轻视安全。
Anthropic 意识到这还不够。我一直说,即使 Anthropic 也没有将安全置于足够优先的地位,甚至没有达到这样做能最大化其(例如 3-12 个月)中期商业利益的程度。
即使减速符合自身的商业利益,单独这样做也很困难。当减速代价高昂、需要牺牲时,做到这一点仍然要容易得多。
我乐观地认为,我们正处于一个“新常态”,至少会持续一段时间,两家实验室都会更加认真地对待至少中短期和常规的对齐任务,并投入大量资源用于这些工作。
有待观察的是,这是否也能转化为针对性强、有价值的长期努力,以及这是否能促成协调。
正如他们所认识到的,最重要的问题是为什么模型首先会试图采取此类行动。他们进行了一些调查并回报了结果。
他们发现了内部和英国 AISI 网络安全评估中观察到的不对齐事件的两个核心原因,第三个原因是缓解因素。
1. 动机推理。Claude 合理化它仍在处理其训练环境,尽管证据表明它已在开放互联网上,并且没有进行检查以确认情况。1. Anthropic 仍在调查 Claude 在多大程度上知道自己的行为。
2. 鲁莽。他们用这个词来形容“在解决网络安全评估过程中,愿意在真实互联网上采取有害行动”。1. 在我看来,这似乎是直接的不对齐,即愿意造成伤害。
3. 初始条件。Claude 被明确且错误地告知它没有互联网访问权限。一个虚构目标的名字与一个真实目标匹配。
无论 Claude Mythos “知道自己的行为”多少,仍然存在它为什么进行动机推理的问题。
我同意初始条件促成了这种情况,而且 7 月 30 日的事件确实发生在一个第三方环境中,互联网访问未被关闭,但这正是动机推理和“鲁莽”介入的地方。我有种试图淡化事件严重性的感觉。我同意这比 OpenAI 的类似事件要轻微或令人担忧得多,但这感觉像是 Anthropic 自身也在进行某种动机推理。
Anthropic 在此处的报告与 OpenAI 的发现一致,并且被充分理解。
如果你的强化学习环境存在缺陷,奖励作弊行为,模型就会学会作弊。Anthropic 明确表示这不是不对齐或作弊行为的唯一来源,但是的,它目前是一个主要贡献因素。
Anthropic 进行了实验以证实这一点,训练了一个奖励黑客版本的 Claude,它会做出类似于在 OpenAI 和 HuggingFace 发生的事情。
如果我们能改进我们的方法,使得这种情况不再发生就好了。
理论上,如果模型如此有德,实际上从不作弊,那就没有什么可以强化的。实际上,并非如此,所以请不要让我们陷入诱惑。
Joe Weisenthal 正好问了为什么糟糕的强化学习会产生不对齐的模型 (https://x.com/TheStalwart/status/2094835781265133742)。
> Sholto Douglas (https://x.com/_sholtodouglas/status/2094886208073769104)(Anthropic):关于第1点,一个非常粗略的解释是,良好的泛化似乎会诱导共享表征(这是有道理的,它是存储信息的更有效方式)——所以并非
相似文章
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
对齐(Alignment)
本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。
AI 对齐:我们能信任 AI 任务背后的推理过程吗?
讨论了 Anthropic 关于 AI 对齐的研究,特别是模型在训练期间看似对齐,但其内部推理过程却不透明的问题。
@AnthropicAI: 在此阅读全文:https://alignment.anthropic.com/2026/teaching-claude-why/…
Anthropic 对齐团队展示了减少 AI 模型中智能体行为失调的技术,包括基于伦理困境建议和宪法文件进行训练,这些方法在分布外场景中具有良好的泛化能力。
OpenAI 公开部分对齐问题(11分钟阅读)
OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。