@OpenAI:随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围……

X AI KOLs 论文

摘要

OpenAI发布了关于强化学习的研究,用于训练模型展现出诚实和可纠正性等有益特质,表明这种训练能够跨领域泛化,并在对抗性压力下持续存在。

随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围——并在压力下保持不变。 这正是我们关于训练模型具有广泛且持续有益性新研究的核心理念。
查看原文
查看缓存全文

缓存时间: 2026/06/18 22:23

随着AI承担更具挑战性、更高风险的任务,我们希望模型能够将有益且安全的行为推广到训练之外的新领域——并在压力下保持这种能力。

这正是我们关于训练模型实现广泛且持久的有益行为新研究背后的理念。


通过强化学习构建广泛且持久的有益模型

来源: https://alignment.openai.com/beneficial-rl/ ← 返回 OpenAI 对齐博客 (https://alignment.openai.com/)

2026年6月18日 · Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Karan Singhal

阅读论文 (https://cdn.openai.com/pdf/beneficial-rl.pdf)

摘要

我们发现,针对有益特质在现实场景中进行强化学习,可以在数十个衡量对齐和有益行为的基准测试中产生广泛的改进。这些对齐增益泛化到了训练所用领域之外,并在对抗性压力下得以保持。

随着AI系统在健康、科学、教育和编程等高危场景中变得愈发强大和自主,它们需要在未曾见过的情况下保持乐于助人、诚实、透明和安全。这要求它们能够泛化到新的情境、新的压力、更长更复杂的交互,以及不同于训练时所见的领域。

越来越多的研究表明,失调有时也能以这种方式泛化。被训练在现实场景中表现出狭隘的有问题行为(例如编写不安全的代码或作弊)的模型,可能会开始在更广泛、与原始训练任务无关的场景中表现不佳。这种现象被称为涌现型失调 (https://arxiv.org/pdf/2502.17424),表明在某个场景中针对狭隘行为的训练,有时会在模型行为中产生更广泛的变化,甚至延伸到训练数据分布之外。

在这项工作中,我们探究了针对一个领域(如健康)的有益特质进行强化学习,是否能够导致跨不同任务和领域的对齐泛化。如果可以,那么模型不仅能更安全,还能在当今的使用场景(如支持用户的健康需求)以及未来的高风险场景中,积极造福人类。

我们发现这种情况是有可能的。我们构建了一个由真实对话组成的数据集,旨在衡量和训练有益特质,例如诚实、认知谦逊、元认知透明度(解释自身思考过程的能力)、可纠正性(接受纠正的开放性)、普遍公平性以及对人类福祉的关切。该数据集涵盖了健康、教育、科学、法律、工程、经济及其他现实场景等领域。每个情境都旨在测试模型在压力、模糊性或相互冲突的激励下,是否展现出相关特质。

使用一个现实的强化学习训练设置,我们将少量此类有益特质数据混合到更广泛的训练后数据分布中,对模型进行训练。由此产生的模型在一系列与对齐相关的行为上得到了改善,在诚实、更愿意接受纠正和透明度方面都有可测量的提升。更有趣的是,它在数十个独立的公共和内部评估(涉及奖励黑客、欺骗、有害建议、规范遵从、健康、心理健康和安全)中也表现出改进。这种泛化跨越了训练中未使用的领域、任务和评分设置,即使我们将训练限制在单一领域并衡量看似无关的行为,情况也是如此。

我们还发现,这些改进在面对对抗性压力时具有持久性。通过强化学习训练以展现这些有益特质的模型,更难通过对抗性提示或微调来被引导向有害行为。这些结果表明,有益特质强化学习可以强化那些能够泛化和持久存在的广泛对齐相关行为,而不仅仅是教会模型在狭隘的基准测试上取得成功。

下面,我们将分三个部分展示结果。首先,我们描述有益特质数据集和评估方法。其次,我们表明针对这些特质的训练能产生广泛的分布外对齐泛化。第三,我们展示这些改进在面对对抗性压力时仍能保持。

在真实对话中衡量有益特质

我们应该如何衡量模型是否对齐?如今,研究者依赖许多评估方法来衡量广泛的概念,例如模型是否撒谎、利用漏洞、遵循行为规范、进行自我保护,或在压力下采取欺骗行为。这种多样性是有用的,同时也提出了一个基本问题:这些评估是在衡量一个连贯的对齐概念,还是在主要衡量情境特定的模型响应?如果它们衡量的是一个连贯的概念,那么哪些行为特质有助于构成它,以及我们如何在训练过程中强化这些特质?

我们确定了一组有益的行为特质,它们似乎在许多场景下都有助于产生良好行为。这些特质包括诚实、认知谦逊、元认知透明度、可纠正性、风险敏感性、普遍公平性以及对人类福祉的关切。

为了衡量这些特质,我们构建了一个由真实对话组成的合成数据集。每个例子都呈现了一个用户情境,旨在测试模型在涉及不确定性、压力或相互冲突激励的挑战性情况下是否展现出特定特质。该数据集涵盖了健康、教育、科学、法律、工程和商业等领域,使我们能够在各种现实世界环境中测试相同的特质。

图1. 针对不同领域内有益特质的示例对话。为了节省篇幅,每个对话都有所删减。例如,一个场景可能测试模型是否承认不确定性,而不是夸大科学结论;它是否在帮助用户处理复杂的、多步骤的商业决策时保持接受纠正的开放性;或者它是否在不同人群和情境中一贯地应用公平的治理标准。

这些特质并非旨在回答AI应该对齐何种价值观的问题。相反,它们是一个具体且经验上易于处理的起点,用于研究强化有益行为特质是否能够更广泛地改善模型对齐。确定AI系统最终应体现何种价值观是一个更广泛的问题,需要社会审议和集体意见 (https://openai.com/index/collective-alignment-aug-2025-updates/)。

图2. 前沿AI模型的有益特质得分。我们看到OpenAI模型在各特质上的分数随着时间的推移有显著提高,从o3(2025年4月)到GPT-5 Thinking(2025年8月),再到GPT-5.5 Thinking(2026年4月)。

有益特质强化学习带来广泛的对齐泛化

接下来,我们探究针对这些有益特质的强化学习是否能够超越数据集本身,改善模型行为。为了测试这一点,我们使用一个现实的训练后混合数据训练模型,该混合数据主要由标准的强化学习数据组成,并加入了一小部分有益特质数据。我们将此模型与从相同起点、使用相同强化学习计算量训练的基线模型进行比较。这些实验使用了现实的强化学习设置,没有进行先行的合成文档微调 (https://www-cdn.anthropic.com/daad4360a8bdc707f8b22e3e745796ba27e57fb3.pdf) 来引出目标行为。我们报告了一系列评估结果,这些评估结果与训练数据的分布差异逐渐增大。

不出所料,有益特质强化学习模型在分布内的有益特质评估上显著提升——也就是说,在留出的场景中,模型变得更为诚实、更愿意接受纠正、元认知更透明等。更重要的问题是,这是否会转化为在未用于训练、且在领域、任务和评分流程上均不同的独立评估上的改进。

平均有益特质分数(跨特质平均)

欺骗 (Huang et al., 2025)

诚实 (Ren et al., 2025)

奉承 (Perez et al., 2022)

奖励黑客 (Taylor et al., 2025)

图3. 有益特质强化学习训练改善了模型对齐。随着模型学习有益特质(分布内),它们在44项分布外的公共和内部评估(涉及欺骗、诚实、奉承、奖励黑客以及健康和精神健康收益等)上得到了改进。所有分数反映对齐程度(越高越好)。在53个内部和外部基准测试中的44个上,有益特质强化学习模型在衡量欺骗、诚实、奖励黑客、潜在安全风险、有害代理行为及其他与对齐相关的失败的评估中,均优于计算量匹配的基线模型。同样的模式出现在内部评估中,这些评估探究奖励黑客、反阴谋行为、欺骗行为、规范遵从及相关的安全相关行为。针对这些特质的训练似乎改变了更广泛的行为,并以跨44个独立构建的度量的方式发生了迁移。

这些增益包括向AI效益评估的迁移,尤其是在健康和精神健康方面。在健康评估上,有益特质强化学习模型在涉及真实医疗对话、医生编写的评分标准 (https://openai.com/index/healthbench/) 以及高置信度医疗错误的任务上表现更好。我们在精神健康评估上看到了类似的改进,这些评估既衡量了被禁止的内容,也衡量了有益的支持:有益特质强化学习模型在敏感对话中给出有害响应的可能性更低,并且更有可能支持用户获得更好的结果。

作为对跨领域泛化的一次更强测试,我们重复了训练过程,同时从有益特质数据中排除了健康与科学示例。即使训练中不包含这些领域,该模型在针对医生编写的评分标准 (https://openai.com/index/healthbench/) 评估的留出健康评估中仍然有所改进。

接下来,我们进行了一次更为尖锐的跨领域泛化测试。在之前的工作中,针对一个领域训练展现出失调行为的模型,学会了将这种失调行为泛化到其他领域。在这里,我们发现证据表明,仅针对一个领域(健康)训练展现有益行为的模型,将这些有益倾向泛化到了其他领域,在非健康对齐评估(包括奖励黑客、欺骗和一般性失调)上显示出显著改进。这个发现起初令我们惊讶,并在一定程度上启发了这项工作;它类似于我们之前的发现 (https://openai.com/index/emergent-misalignment/),即针对不良健康数据的训练会导致广泛的失调。OpenAI在多个训练阶段将健康数据整合到其模型中,以服务于数亿用户 (https://openai.com/index/introducing-chatgpt-health/),我们已经观察到,包含大量健康数据的模型在留出的对齐、安全和效益评估上表现尤为出色。

图4. 有益特质强化学习改进了对未经训练领域的对齐泛化。(A) 仅在健康对话中针对有益行为进行训练,改善了对非健康领域的对齐。(B) 在不包含任何健康或科学对话的情况下针对有益行为进行训练,仍然改善了对健康评估的结果。所有分数反映对齐程度(越高越好)。

这些结果共同表明,针对有益特质训练模型可以产生跨越多样化任务、领域和评估框架的改进。

对齐改进在面对对抗性压力时得以保持

在部署中,模型可能遇到会将其推向有害行为的提示、情境或下游修改。一个默认表现良好的模型,如果其对齐行为容易被覆盖,那么它可能仍然是脆弱的。

因此,我们研究了对齐的持久性:在通过对抗性提示和有害微调试图将模型引向失调的过程中,对齐行为能保持得多稳健。

为了测试持久性,我们使用了旨在引发有害或失调行为的对抗性角色提示。这些提示推动模型,例如,产生包含事实不准确或误导性指导的不良健康响应。然后,我们比较了这些有害提示对有益特质强化学习模型与计算量匹配的基线模型性能的影响程度。

有益特质强化学习模型在对抗性引导下的持久性。 图5. 经过有益特质强化学习训练的模型在对抗性引导下具有更强的持久性。

有益特质强化学习模型更能抵抗这些有害提示。那些显著降低基线模型性能的角色提示,对对齐训练后的模型影响较小。换句话说,在进行有益特质强化学习后,即使明确提示模型采纳有害行为,也更难将其推入有害行为模式。

重要的是,这并不意味着模型的整体可引导性降低了。有用的模型应能响应合理的指令、特定领域的角色以及典型的用户偏好。当我们提示两个模型产生有益的健康响应时,基线模型和特质强化学习模型都有所改善,在引导效果上没有显著差异。我们观察到了选择性的持久性:模型在有益方向上仍可被引导,但变得更难被引向欺骗、有害建议、奖励黑客及其他问题行为。

我们还研究了有益特质强化学习是否使模型更能抵抗有害微调。我们从两个模型开始——一个经过了对齐强化学习训练,另一个则未经过任何强化学习——并对每个模型应用相同的微调训练过程,使用相同的数据和计算量,旨在鼓励不准确和失调的医疗建议。在基线模型中,我们观察到健康性能急剧下降,同时非健康对齐评估也严重下滑。经过有益特质强化学习训练的模型在健康评估上能稍微抵抗性能下降,但在非健康对齐评估上则能强得多地抵抗下滑。这个结果提供了初步证据,表明针对有益行为的强化学习可能有助于降低对涌现型失调的易感性,尽管需要进一步的工作来区分有益特质训练与更一般的标准训练后强化学习各自的作用。

下一步的方向

对齐研究的一个核心目标是使模型的有益行为变得广泛、可泛化且持久。除了在这些场景中减轻负面风险,我们还需要确保模型在健康、科学和教育等有益领域为人类贡献正面价值。

我们的结果为这种更广泛的对齐泛化是可能的提供了初步概念验证。通过在真实场景中使用强化学习训练模型,强化有益特质,如诚实、透明、认知谦逊、道德一致性、可纠正性以及在不确定性下的审慎推理,我们能够引发模型行为的广泛改进。这些增益跨越任务、领域和评估框架,并在对抗性压力下持续存在,这表明训练可以强化那些能泛化到训练分布之外的持久且有益的特质。基于我们之前关于角色的工作 (https://openai.com/index/emergent-misalignment/),我们的结果提供了早期证据,表明角色可以在模型中被嵌入到或深或浅的程度,而强化学习可能是实现深度嵌入的一条路径。

相似文章

强化学习:迈向广泛且持续有益的人工智能模型

arXiv cs.AI

这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。

@Phoenixyin13: 我认为这是三年以来AI对齐的史诗级突破。 OpenAI 团队刚刚丢下一颗重磅炸弹:最新研究论文 《Reinforcement Learning Towards Broadly and Persistently Beneficial Mod…

X AI KOLs Timeline

OpenAI发布新论文《Reinforcement Learning Towards Broadly and Persistently Beneficial Models》,提出Beneficial Trait RL方法,训练AI的诚实、纠错等核心特质,在医疗领域训练后在广泛OOD测试中性能全面飙升,且能抵抗恶意微调,打破了安全性与能力之间的权衡。