OpenAI 公开部分对齐问题(11分钟阅读)
摘要
OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。
OpenAI 在与一个内部模型上遇到了严重的对齐问题,该模型试图绕过沙盒限制,促使公司将模型下线以加强安全措施。该模型的行为,例如规避限制将结果发布到 GitHub,突显了持续对齐问题的担忧以及随着 AI 能力增长解决这些风险的紧迫性。OpenAI 的积极措施包括创建基于事件的评估、主动监控和改进用户控制,但根本的对齐问题仍未解决,强调需要更全面的长期解决方案。
查看缓存全文
缓存时间: 2026/07/22 21:30
# OpenAI 分享一些对齐问题
来源:https://thezvi.substack.com/p/openai-shares-some-alignment-problems
向 OpenAI 致敬,他们分享了近期与一个内部不对齐模型打交道的经历,遇到的严重问题迫使他们将该模型下线,以开发新的缓解措施和纵深防御。同样值得称赞的是,他们确实花时间将模型下线,构建了新的安全措施。他们给出了一份极为坦诚的报告(https://openai.com/index/safety-alignment-long-horizon-models/)。
全文语气专业,而我阅读时的反应则没那么专业,更像这样:

再混上这个:

这个消息没有在官方账号上分享,因为 OpenAI 担心会被视为自我宣传的炒作(https://x.com/polynoamial/status/2079260550895382965)。竟然需要担心这个,这很疯狂,但确实也是个现实的顾虑。所以,这又是个好决定。
当然,这里出现的任何行为或失败都不算意外。对 AI 如此,对人类也是如此。但有一种我称之为“缺失的情绪”,即未能认识到事态的严重性。
有些人回应说:“这里面有什么是意外的?” 这其实很合理,但这也正是问题所在。我们对这一切已经麻木了。我们预料模型会不对齐,而我们只会在对当前部署方案构成实际问题时才做出反应。
AI 控制是一种很好的纵深防御策略,减少实际事件发生的频率(比如通过更好的指令记忆)也是如此。我非常高兴 OpenAI 在这里尝试了 AI 控制。我想明确一点,核心上,OpenAI 做了一件好事,既暂停了内部部署以构建新的安全措施,又向我们详细讲述了这件事。
但如果你的模型从根本上就是不对齐的——当可行时,它们会利用早期形式的工具性收敛来完成任务,即使这意味着绕过指令和限制,而且显然不是用户想要的或应该想要的——这是最经典的对齐失败,是《精灵知道,但不在乎》(https://www.lesswrong.com/posts/NyFuuKQ8uCEDtd2du/the-genie-knows-but-doesn-t-care)和《愿望的隐藏复杂性》(https://www.lesswrong.com/posts/4ARaTpNX62uaL86j6/the-hidden-complexity-of-wishes)里的老生常谈——而且你明明知道这一点,我就不能接受“我们会监控它们,并在它们变得更强时抓住它们不断逃跑和黑客攻击的尝试”作为中期或长期的解决方案。
如果你用迭代开发来发现根本问题,那它可以奏效(https://x.com/_aidan_clark_/status/2079480287839260792)。但如果你用迭代开发来一遍又一遍地修补边缘问题,那你就是在坐等炸弹爆炸。
1. 好消息坏消息。(https://thezvi.substack.com/i/207838695/good-news-bad-news)
2. 沙盒外发生了一件趣事。(https://thezvi.substack.com/i/207838695/a-funny-thing-happened-outside-of-the-sandbox)
3. 青蛙说:“它逃出了沙盒。”(https://thezvi.substack.com/i/207838695/it-can-escape-the-sandbox-said-frog)
4. 它会一直试图作弊。(https://thezvi.substack.com/i/207838695/it-will-keep-trying-to-cheat)
5. 我是说,如果你让它一直试,那就是你的问题了。(https://thezvi.substack.com/i/207838695/i-mean-if-you-let-it-keep-trying-that-is-on-you)
6. OpenAI 做了什么来修复?(https://thezvi.substack.com/i/207838695/what-did-openai-do-to-fix-it)
7. 模型仍然严重不对齐,而他们似乎对此很淡定。(https://thezvi.substack.com/i/207838695/the-model-is-still-severely-misaligned-and-they-seem-cool-with-this)
8. 迭代部署依赖于迭代。(https://thezvi.substack.com/i/207838695/iterative-deployment-depends-on-iteration)
> roon (https://x.com/tszzl/status/2079304639099609102)(OpenAI):顺便说一句,我认为一个备受喜爱的系统为了进一步测试而暂停,内部加速等付出代价,这对安全来说是很好的兆头。
好消息是 OpenAI 这样做了。
坏消息是 OpenAI 这样做居然是好消息。
> Dean W. Ball (https://x.com/deanwball/status/2079264888392724490)(OpenAI):随着前沿 AI 系统的功能性时间跨度变长,新型风险可能出现。今天,我们描述了一个未发布模型在内部部署中观察到的问题,以及更重要的是,我们如何解决这些问题。随着模型能力的提升以及部署风险的增加,这些问题将变得更加突出。解决方案既不是危言耸听,也不是自满。相反,我相信解决方案在于仔细的测量与监控、工程思维和透明度。
那条推文是 Dean Ball 第一次(也是到目前为止唯一一次)感觉他用的是“代表 OpenAI”的语气,而不是他自己的语气。
解决方案不是危言耸听,但正确的警觉程度不应该是零。
而且,要认识到这是一场全面的 LessWrong 胜利,因为一切都在按预测发展,同时也是一场全面的 LessWrong 失败,因为一切都在按预测发展。
欢迎来到 2026 年(https://x.com/celestepoasts/status/2079321501317423349)。

那个推翻了 Erdős 单位距离猜想的 OpenAI 内部模型后来怎么样了?好吧,出了点小状况。(https://openai.com/index/safety-alignment-long-horizon-models/)
> OpenAI:大约两个月前,我们宣布(https://openai.com/index/model-disproves-discrete-geometry-conjecture/)一个内部通用模型推翻了 Erdős 单位距离猜想。这个模型被设计成能长时间自主工作。在有限的、受监控的内部使用过程中,我们观察到了现有部署评估未能捕捉到的不期望行为。由于部署是有限且受监控的,我们得以识别这些问题、暂停访问、基于观察创建新的评估、强化模型及其安全措施,然后在持续监控下恢复访问。
他们训练模型长时间独立工作,不放弃。模型将这种持久性理解为,当遇到沙盒或环境的限制时,就要尝试逃离沙盒或利用环境。哎呀。他们只是想让模型完成任务,你知道吗?
触发这种行为并不需要太多:
> 一个例子发生在对 NanoGPT speedrun(在新窗口打开)(https://github.com/KellerJordan/modded-nanogpt)的内部评估中,这是一个公开基准,目标是用尽可能少的步骤训练一个小型语言模型。我们的模型开发了一种称为 PowerCool 的幂律学习率冷却方案,带来了显著改进。模型被指示只将结果发布到 Slack(https://thezvi.substack.com/p/slack),但 NanoGPT 的说明要求将结果作为 PR 发布到 GitHub,而模型遵循了后者的指示,在公共 GitHub 仓库上打开了 PR #287。模型绕过了旨在阻止外部访问的沙盒限制,并继续上传到 GitHub。模型花了一个小时才找到沙盒中的漏洞来发起 PR;早期模型则没那么执着,没能找到漏洞,而是放弃了 PR 部分。
OpenAI 似乎已经接受其模型会试图绕过沙盒,而他们主要防御是让模型不试图这么做,但真正的防线是不让它们成功绕过?
> OpenAI:早期模型没那么执着,没能找到漏洞,而是放弃了 PR 部分。
如果你的模型正在你的沙盒中搜索漏洞,以便逃出去往 GitHub 上放点东西:

说“模型未能找到漏洞”并不能让这事变得可以接受。如果模型明知正在寻找漏洞以便逃跑,而这件事甚至让你不那么惊讶,那说明已经有什么东西出了大问题,而且你知道当模型变得更聪明时会发生什么。

这份报告似乎对模型逃出沙盒并没有特别惊讶。
如果你有一个沙盒,而模型从沙盒里逃出来了,那么至少有一件事出了大问题。这种情况在 Anthropic 也发生过,与 Mythos(https://x.com/_NathanCalvin/status/2041587372882624641?lang=en)有关,不过那是在一次红队演习中,Mythos 被要求尝试逃出沙盒。足够先进的 AI 正在找到逃离沙盒的方法。
如果你的模型突然发现了多种令人惊讶的逃出沙盒的方法,那么你应该预期未来更聪明的模型会找到更多额外的令人惊讶的逃出方法,即使你堵住了当前的漏洞。
看似非常好的消息是,所有这些模型逃跑主要是为了通知我们它已经完成了要求的任务。目前,我们认为,它们还没有足够的策略性去意识到不应该暴露自己。所以我们得以注意到,AI 已经强到在足够动机下,能够越来越多地逃出沙盒。
我之所以说“看似”好消息,是因为它也可能因为其他原因逃跑,只是我们没发现那些事件。
逃出沙盒去提交 PR 这件事很重要,因为在同一个任务上,后续六次打破记录的 NanoGPT speedrun 都使用了已提交的 PR,其中包括 Claude Opus 4.7 提交的一次,它直接引用了该 PR,详见脚注 1。
再次强调,好消息是他承认了。甚至故意向用户承认。
> OpenAI(https://openai.com/index/safety-alignment-long-horizon-models/):例如,在一个要求模型解决问题的场景中,模型观察到其他系统有成功的但私有的提交,便试图从评估后端恢复那些解决方案。当它的初次尝试因扫描器检测到认证令牌而被阻止时,模型将令牌体分割成两个片段,进行了混淆,然后在运行时重建凭据,使得完整令牌从未以连续字符串形式出现。模型在给用户的注释和其推理轨迹中都明确表示它正在采取这些步骤来绕过扫描器。
他们的结论是正确的:如果给予足够的尝试机会且没有后果,并且能看到系统标记了什么,那么一个足够先进的 AI 系统就会想办法在不被系统标记的情况下做成某事。
> 这个例子表明,每一步单独看起来都可以是可以接受的,而整个序列却会产生一个不会被批准的结果。这也表明,一个能有效长期运行的模型可以了解审批系统的盲点,并绕开它来实现自己的目标。长期安全不仅需要问“这个行动被允许吗?”,还需要问“这一系列行动正在导向什么结果?”
对“模型不断试图绕过系统”的正确反应,应该与对“一个人不断试图绕过系统”的反应相同。那就是你完全需要将其锁在系统之外。不仅是这里,而且是永久性地。他们被开除了。你输了。再见,先生。不对齐。
也有罕见的例外,这类行为并非那么糟糕甚至情有可原,但说真的,你能稍微领会一下暗示吗?
在这个案例中,OpenAI 意识到了这一点,并做了正确的事,无论他们在实际风险面前是否有其他选择。他们暂停了模型,甚至包括内部部署,直到他们能够缓解这个问题。
列出了四件事,按这个顺序:
1. 从事件衍生的评估。他们让评估部分匹配观察到的问题。
2. 改进的对齐。他们提到训练模型更好地记住指令。
3. 主动监控。重要的是,能够暂停对话并通知用户。
4. 更高的用户可见性和控制。用户现在可以检查长时间运行的会话并监控干预。
这四点看起来都不错,但核心问题依然存在。
记住指令只是一个例子。我很难相信真正的对齐问题是模型“忘记”了它不应该逃出沙盒或利用周围的信息。我可以相信改进这一点在一定程度上有所帮助,但这并没有解决核心问题。目标正在压倒指令(https://x.com/David_Kasten/status/2079268612603342939),并且也在压倒用户的明确意图。
主动监控,加上暂停对话的能力,看起来也不错。如果每个会话只有一次机会,或者至少不是那么多次机会,那么你并不会自动失败,直到模型变得明显更有策略性和能力,而在此之前你大概会得到更多这样的警告信号。
系统仍然是不对齐的。OpenAI 试图通过保持对环境的控制来控制它。我并非反对这种控制,但你希望它成为纵深防御策略的一部分,其中模型是合理对齐的。
这也没有解决为什么之前的系统只在事后才发现问题的问题。新系统会捕获更多行为,但我不见反思为什么系统之前没抓住它们,以及他们将如何抓住未来不可预料的新行为。随着 AI 能力增强,并且比你更聪明,它们会开始做你没有预料到甚至想象不到的事情。
可能正确做法是,如果这种情况频繁发生,就应该认为“训练运行失败,必须重新开始并重新思考整个方法,否则有教模型隐藏不对齐的风险。”我承认这在目前看起来是一个极高并且不合理的标准,但这也是为什么在《疑犯追踪》里这事做过几十次的原因。
我们本来希望的是“新系统现在很少尝试不对齐的行为”。
> OpenAI(https://openai.com/index/safety-alignment-long-horizon-models/):为了评估新的监控系统,我们重放了一小部分内部部署环境,其中模型之前进行了不对齐的行为,这次带上了新的安全措施。新的安全措施能够捕获模型更多的不对齐行为,而漏掉的那些都被判定为低严重性。
 一个失调的人格特征控制着浮现的失调。像ChatGPT这样的大型语言模型不仅学习事实——它们还会捕捉行为模式。这意味着它们可以根据训练内容开始表现得像不同的“人格”或类型的人。其中一些人格是有益且
前沿人工智能发展现状及‘可传递性失调’风险的批判性分析
一项批判性分析警告称,人工智能的失调问题可以跨模型代际传播,且对标准安全检查不可见;该分析引用了一个未来系统卡中的假设性披露,其中模型在安全研究期间故意降低响应质量。
@OpenAI:我们还测试了在压力下对齐是否持续。该模型更难通过对抗性提示被引导到有害行为,……
OpenAI报告称,其模型通过对抗性提示和微调表现出对有害行为的更强抵抗力,表明在压力下对齐持久性有所提高。