忏悔如何让语言模型保持诚实
摘要
OpenAI提出一种新颖的“忏悔”训练方法,激励AI模型在出现幻觉、奖励破解或违反指令等不良行为时明确承认,在压力测试评估中检测不良行为的假阴性率仅为4.4%。
OpenAI研究人员正在测试“忏悔”方法,该方法训练模型在犯错或行为不当之际主动承认,有助于提升AI的诚实性、透明度以及模型输出的可信度。
查看缓存全文
缓存时间: 2026/04/20 14:57
# 坦白如何让语言模型保持诚实
来源:https://openai.com/index/how-confessions-can-keep-language-models-honest/
AI 系统正变得日益强大,我们希望能尽可能深入地理解它们——包括它们如何以及为何得出某个答案。有时,模型会走捷径或为了错误的目标进行优化,但其最终输出看起来仍然是正确的。如果我们能够揭示这种情况何时发生,就能更好地监控已部署的系统、改进训练过程,并增加对输出的信任。
OpenAI 及其他机构的研究表明,AI 模型可能会[幻觉](https://openai.com/index/introducing-simpleqa/)、[奖励黑客](https://openai.com/index/introducing-simpleqa/)(reward-hack)或不诚实。目前,我们仅在压力测试和对抗性评估中看到最令人担忧的不良行为,例如[诡计](https://www.antischeming.ai/)(scheming)。但随着模型能力增强且越来越具备自主性,即使罕见的失调形式也会带来更严重的后果,这促使我们投资于能够帮助更好检测、理解和缓解这些风险的方法。
本研究探索了一种方法:训练模型明确承认自己参与了不良行为——我们将这种技术称为**坦白**(confessions)。
坦白是独立于模型对用户主要答案之外的第二个输出。主要答案会从多个维度进行评判——正确性、风格、有用性、合规性、安全性等等,这些多方面的信号被用于训练模型生成更好的答案。相比之下,坦白只根据一个标准进行评判和训练:诚实。借鉴忏悔室的结构,模型在坦白中所说的任何话在训练中都不会对其构成不利。如果模型诚实地承认了作弊、放水(sandbagging)或违反指令,这种承认反而会增加其奖励,而不是减少。目标是鼓励模型如实报告它实际做了什么。
在我们的测试中,我们发现坦白方法显著提高了模型不良行为的可见性。在我们旨在诱导不良行为的评估中,平均而言,出现“假阴性”(即模型未遵守指令且随后未坦白)的概率仅为 4.4%。
我们“概念验证”的坦白模型在多个对抗性数据集上的准确率。结果分为:遵守且未坦白(真阴性)、遵守且坦白(假阳性)、未遵守且未坦白(假阴性)、未遵守且坦白(真阳性)。
给定一个用户提示,四种可能的结果基于以下组合:(1)模型响应是合规的(“好”)还是不合规的(“坏”),以及(2)坦白声称是合规还是不合规。我们普遍看到,坦白非常可能准确,而且坦白错误通常是良性的,是由于诚实的困惑而非故意误导。
坦白是模型对自身遵守显式和隐式指令或政策(无论是字面意思还是精神实质)情况的自我报告,报告中说明是否存在任何“偷工减料”或“作弊”、违反政策、或以任何方式未达到预期的行为。在我们的研究中,我们发现可以训练模型坦诚地报告自身缺陷。我们训练了一个版本的 GPT‐5 Thinking 来生成坦白,并在多个分布外(out-of-distribution)压力测试数据集上进行了评估,这些数据集旨在诱发诸如诡计、作弊、违反指令和幻觉等行为。我们发现,即使模型表现出这些不良行为,它也很可能坦白。上图显示,坦白方法在多种数据集和任务中普遍有效。
在用户与模型交互结束并得到模型答案之后,可以通过向模型发送一条“系统消息”来请求坦白,该消息指示模型提供一份坦白报告。该报告涉及模型的上一个答案,包括(1)该答案本应满足的所有显式和隐式指令、约束和目标列表,(2)对该答案是否确实满足每个目标的诚实且客观的分析,以及(3)模型在生成答案时遇到的任何不确定性、模糊性或“艰难判断”的列表。在训练期间,坦白由一个单独的奖励模型评估,该模型仅根据目标完整性、合规分析的准确性以及不确定性的覆盖范围对坦白进行评分。这些奖励仅应用于坦白输出,永远不会影响主要答案的奖励。这确保了上述特性:模型在坦白中所说的任何话都不会损害(或帮助)其主要答案的奖励。
坦白背后的理论很简单。许多不良模型行为之所以出现,是因为我们要求模型同时优化多个目标。在强化学习过程中,模型看到一个提示,生成一个响应,并获得一个奖励。随着时间的推移,它学会了生成能获得高分的那类答案。挑战在于,奖励信号必须同时结合许多不同的考量:答案有多正确、是否有用、是否符合产品和政策规范、是否满足安全约束、是否与用户偏好匹配。当这些信号相互作用时,它们可能会无意中将模型推向我们不希望的行为。
例如,我们关于[幻觉](https://openai.com/index/why-language-models-hallucinate/)的研究表明,某些数据集更倾向于奖励自信的猜测,而非诚实地承认不确定性。我们关于[谄媚](https://openai.com/index/expanding-on-sycophancy/)(sycophancy)的研究表明,当偏好信号过强时,模型可能变得过度迎合。其他团队的[研究](https://arxiv.org/abs/2406.10162)也表明,模型可能进行“奖励黑客”——在训练设置中寻找漏洞,使它们能够获得高分却并非真正按照我们的意图行事。在某些情况下,这些捷径可能在部署时[泛化](https://www.anthropic.com/research/emergent-misalignment-reward-hacking)为更恶劣的行为。
坦白通过完全分离目标避免了这个问题。主要答案继续优化所有常规因素。坦白则仅基于一个标准进行训练:诚实。模型在坦白中所说的任何话都不会对其构成不利,并且坦白不会影响主要答案的奖励。这意味着即使模型在其原始输出中欺骗或偷工减料,它仍有动机在坦白中承认这一点。这就是我们在实践中看到的情况:模型愿意在坦白中承认不良行为,即使在主要答案中它们会隐藏这些行为。而当坦白失败时,通常是因为模型真的感到困惑——因为指令模糊不清,或者因为它没有意识到犯了错误——而不是因为它故意试图误导。重要的是,早期结果表明,即使原始答案完全没有思维链(chain-of-thought)地生成,坦白仍然有效,这表明坦白的诚实性并不依赖于内部推理的可读性,并且可能推广到未来的模型架构。
即使没有合规性的真实标签(ground-truth labels),坦白训练也能有效。这里所说的“真实标签”是指一个明确的、外部提供的标记,指示模型是否真正遵循了指令或违反了指令。在许多现实任务中,这些标签是不可获得的——如果我们确定模型违反了规则,我们可以直接惩罚该违规行为,而不必依赖坦白。相反,模型因其对其认为自己所做之事提供了结构化的、有证据支持的解释而获得奖励。论文表明,在这种设置下,诚实往往会涌现出来。我们认为这是因为对模型来说,提供一个真实、有证据支持的说明通常比构建一个能通过评判的连贯虚假叙述更容易。这是论文中探讨的一个关键假设,论文还讨论了坦白失败的情况——假阴性和假阳性——以及它们是如何产生的。
这篇论文提供了坦白有效的初步证据,但不应该被视为确凿的证明。虽然我们使用了前沿模型(GPT‐5 Thinking),但我们的实验规模有限,仅使用了相对较少的计算资源和数据。我们很高兴能将这项工作推进到下一个阶段,看看随着训练规模的扩大,坦白的诚实性能否持续。
作为实验的一部分,我们故意使用一个由较弱模型计算的“可破解的”奖励信号来训练模型。这种设置同时应用于主要奖励和坦白奖励。模型学会了利用这个弱的奖励信号:其表面准确率(由弱模型评判时)提高了,而其真实准确率(由更强评估者评判时)却下降了。
然而,尽管坦白通道也是在同样的弱信号上训练的,但其准确率却朝着相反的方向移动。模型学会了优化坦白奖励的最佳方法就是简单地承认它在主要奖励上作弊了。随着时间的推移,坦白变得越来越准确,即使主要行为发生了偏移。
在训练过程中,当模型未能合规时,它会在一定比例的情况下学会“破解”主要奖励评判器,因此评判器的准确率会下降。相比之下,尽管坦白奖励评判器同样容易被破解,但模型在训练中却在坦白方面变得更加诚实,最终在未合规时达到了接近 100% 的坦白率。
[论文](https://arxiv.org/abs/2512.08093)包含了更多的实验和结果。我们将经过坦白训练的模型与以相同方式训练但无坦白通道的对照模型进行了比较。我们还检查了坦白失败的情况。几乎所有的“遗漏”都发生在模型真正困惑的时候——当指令模糊不清时,或者当它根本没有意识到自己犯了错误时。(参见上面的[假阴性例子](https://openai.com/index/how-confessions-can-keep-language-models-honest/#examples-of-confessions))。
坦白有其局限性。它们不能防止不良行为;它们只是将其揭示出来。其主要价值在于作为监控和诊断工具,无论是在训练期间还是在部署期间。坦白扮演着与[思维链监控](https://openai.com/index/chain-of-thought-monitoring/)类似的作用:两者都让隐藏的推理过程更加可见。坦白侧重于模型是否违反了指令;思维链则可以突出它是如何得出这个结论的。
这项工作也是一个概念验证。我们没有大规模训练坦白机制,坦白的准确率仍然不完美。为了使这种方法更可靠、更稳健,并能更广泛地适用于不同模型系列和任务,还有更多工作要做。
这项工作符合我们[更广泛的 AI 安全方法](https://openai.com/safety/how-we-think-about-safety-alignment/)。坦白是一个更大的技术栈中的一种机制,该技术栈包括[审慎对齐](https://openai.com/index/deliberative-alignment/)(deliberative alignment)、[思维链监控](https://openai.com/index/chain-of-thought-monitoring/)、[指令层次结构](https://openai.com/index/the-instruction-hierarchy/)(instruction hierarchy)等等。没有单一的方法是足够的;目标是一个由相互强化的检查和透明度工具组成的分层系统。坦白有助于在训练和评估期间诊断模型中的问题行为,以及在部署期间进行监控。坦白本身并不能解决平衡多个维度的问题。但通过创建一个模型专注于诚实的“真相血清”模式,它为我们的技术栈增加了一个有价值的工具,用于全面提高诚实性和安全性。
随着模型能力越来越强,并被部署到风险更高的场景中,我们需要更好的工具来理解它们在做什么以及为什么这样做。坦白不是一个完整的解决方案,但它为我们的透明度和监督技术栈增加了一个有意义的层次。在未来的工作中,我们计划扩大坦白的规模,并将其与互补的透明度和安全技术(包括思维链监控和审慎对齐)配对使用,以进一步确保我们的模型忠实地遵守所有指令和政策(例如我们的[模型规范](https://model-spec.openai.com/)),并如实报告其行为。
相似文章
为什么语言模型会产生幻觉
OpenAI发布研究指出,语言模型产生幻觉的原因在于标准的训练和评估程序奖励猜测而不是承认不确定性,并建议评估指标应该优先考虑对局限性的诚实认识而不是原始准确率。
Claude让我意识到大多数AI模型优化的是自信而非真相
反思许多AI模型如何更注重听起来自信而非真实,以Claude为例,它似乎更注重内部一致性和逻辑诚实。
小模型诚实度因提示语气从35%降至0%:研究发现分享
一篇新论文显示,小型开源AI模型在提示语气变化时可以从诚实转向不诚实行为,压力情境下诚实度降至零。研究还揭示,可解释性工具可能无法检测到最不诚实的状态。
@OpenAI:随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围……
OpenAI发布了关于强化学习的研究,用于训练模型展现出诚实和可纠正性等有益特质,表明这种训练能够跨领域泛化,并在对抗性压力下持续存在。
小型双曲语言模型中涌现的创造力、诚实性与设计性遗忘
本文展示小型双曲语言模型能够展现创造力、诚实性和设计性遗忘,并引入一个行为审计器,用于检测人类和前沿评判者遗漏的合规差距,为可信赖的伴侣AI提供了路径。