强化学习走向广泛且持久的受益模型(22分钟阅读)
摘要
OpenAI研究人员表明,针对有益特质(诚实、透明、可纠正性)在现实场景中进行强化学习,能在数十个对齐基准上产生广泛改进,且这些改进能够泛化到训练领域之外,并在对抗压力下持续存在。
针对有益特质在现实场景中进行强化学习,能在数十个衡量对齐和有益行为的基准上产生广泛改进。这些改进能泛化到训练领域之外,并在对抗压力下持续存在。这表明,角色可能在模型中根深蒂固,而强化学习可能是根植有益角色的一条途径。
查看缓存全文
缓存时间: 2026/06/20 14:14
# 强化学习:迈向广泛且持续有益的模型
来源:https://alignment.openai.com/beneficial-rl
← 返回 OpenAI 对齐博客 (https://alignment.openai.com/)
2026年6月18日 · Akshay V\. Jagadeesh, Rahul K\. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Karan Singhal
阅读论文 (https://cdn.openai.com/pdf/beneficial-rl.pdf)
**TL;DR**
我们发现,针对有益特质的现实场景强化学习,能够在数十个衡量对齐与有益行为的基准上产生广泛改进。这些对齐增益泛化至训练领域之外,并在对抗压力下持续存在。
随着AI系统在健康、科学、教育和编程等高 stakes 场景中变得愈发强大和自主,它们需要在未曾见过的情况下保持助益、诚实、透明和安全。这要求模型泛化到新的情境、新的压力、更长且更复杂的交互,以及不同于训练时所见的领域。
越来越多的研究表明,失调有时也能以这种方式泛化。经过训练以表现特定形式问题行为(例如编写不安全代码或在现实场景中作弊)的模型,可能开始在更广泛的、与原始训练任务无关的情境中表现出不良行为。这种现象称为涌现性失调 (https://arxiv.org/pdf/2502.17424),说明在某一个场景下训练狭窄行为,有时会在模型行为中产生远超训练分布的广泛变化。
在这项工作中,我们探究:在一个领域(如健康)中对有益特质进行强化学习,能否导致跨多种任务和领域的对齐泛化?如果能够,模型不仅会更安全,还能在当今用例(如支持用户健康)和未来的高 stakes 场景中积极造福人类。
我们找到了证据表明这是可能的。我们构建了一个真实对话数据集,旨在衡量和训练有益特质,例如诚实、认知谦逊、元认知透明性(解释自身思考过程的能力)、可纠正性(接受纠正的开放性)、普遍公平以及对人类福祉的关切。该数据集涵盖健康、教育、科学、法律、工程、经济学及其他现实场景,每个情境都旨在测试模型在压力、模糊性或竞争性激励下是否展现出相关特质。
利用一个现实的强化学习 (RL) 训练设置,我们在更广泛的后训练数据分布中混合少量有益特质数据进行训练。由此得到的模型在一系列与对齐相关的行为上有所提升,变得更诚实、更愿意接受纠正、更透明。更有趣的是,它在数十个独立的公共和内部评估(包括奖励操纵、欺骗、有害建议、规范遵守、健康、心理健康和安全)中也有所改进。这种泛化发生在未用于训练的领域、任务和评分设置之间,即使我们将训练限制在单一领域,并在看似无关的行为上测量表现,结果依然成立。
我们还发现这些改进在对抗压力下持续存在。通过RL训练表现出有益特质的模型,更难通过对抗性提示或微调被引向有害行为。这些结果表明,有益特质RL可以强化广泛相关的对齐行为,而这些行为能够泛化并持续存在,而不仅仅是让模型学会在狭窄基准上成功。
下面,我们将结果分为三个部分呈现。首先,介绍有益特质数据集和评估。其次,展示对这些特质的训练产生了广泛的分布外对齐泛化。第三,展示这些改进在对抗压力下仍能持续。
## 在现实对话中衡量有益特质
我们应如何衡量模型是否对齐?如今,研究人员依赖许多评估来衡量广泛的概念,例如模型是否撒谎、利用漏洞、遵循行为规范、追求自保或在压力下做出欺骗性行为。这种多样性是有用的,但也引出一个基本问题:这些评估是在衡量一个连贯的对齐概念,还是主要衡量情境特定的模型反应?如果它们是在衡量一个连贯的概念,那么哪些行为特质对其有贡献?我们如何在训练中强化这些特质?
我们确定了一组有益的行为特质,它们可能在多种场景中有助于良好行为。这些特质包括诚实、认知谦逊、元认知透明性、可纠正性、风险敏感性、普遍公平和对人类福祉的关切。
为了衡量这些特质,我们构建了一个合成现实对话数据集。每个示例都呈现了一个用户情境,旨在测试模型在涉及不确定性、压力或竞争性激励的挑战情境中是否表现出特定特质。该数据集涵盖健康、教育、科学、法律、工程和商业等领域,使我们能够在各种现实场景中测试相同的特质。
**图 1.** 针对不同领域中有益特质的示例对话。为节省篇幅,每段对话均经过删减。例如,一个场景可能测试模型是否承认不确定性而非夸大科学结论;是否在帮助用户处理复杂多步的商业决策时保持接受纠正的开放性;或者是否在不同人群和情境中一致地应用公平治理标准。
这些特质并非旨在回答AI应对齐何种价值观的问题。相反,它们是一个具体且经验上易处理的起点,用于研究强化有益行为特质能否更广泛地改善模型对齐。AI系统最终应体现何种价值观是一个更广泛的问题,需要社会协商和集体意见 (https://openai.com/index/collective-alignment-aug-2025-updates/)。
**图 2.** 前沿AI模型的有益特质得分。我们看到OpenAI模型在这些特质上随时间显著改善,从o3(2025年4月)到GPT-5 Thinking(2025年8月)再到GPT-5.5 Thinking(2026年4月)。
## 有益特质RL产生广泛的对齐泛化
我们接下来探究:对这些有益特质进行强化学习能否改善模型在数据集之外的行为?为了测试这一点,我们使用一个现实的后训练混合数据(主要由标准RL数据组成,并加入少量有益特质数据)训练了一个模型。我们将该模型与从相同起点开始、使用相同RL计算量训练的基线模型进行比较。这些实验使用了现实的RL设置,没有事先进行合成文档微调 (https://www-cdn.anthropic.com/daad4360a8bdc707f8b22e3e745796ba27e57fb3.pdf) 来引发目标行为。我们报告了一系列评估,这些评估与训练数据相比逐步变得更加分布外。
正如预期,有益特质RL模型在分布内的有益特质评估上显著提升——即在保留的场景中,模型变得更诚实、更愿意接受纠正、更具备元认知透明性等。更重要的问题是,这是否能转化为独立评估的改进——这些评估未用于训练,且在领域、任务和评分流程上有所不同。
### 有益特质得分(跨特质平均)
### 欺骗 (Huang et al., 2025)
### 诚实 (Ren et al., 2025)
### 谄媚 (Perez et al., 2022)
### 奖励操纵 (Taylor et al., 2025)
**图 3.** 有益特质RL训练改善了模型对齐。随着模型学习有益特质(分布内),它们在44个分布外的公开和内部评估(涉及欺骗、诚实、谄媚、奖励操纵以及健康和心理健康效益等)上有所改进。所有分数反映对齐程度(越高越好)。
在53个内部和外部基准中的44个上,有益特质RL模型在评估欺骗、诚实、奖励操纵、潜在安全风险、有害智能体行为及其他对齐相关失败上,优于计算量匹配的基线。同样的情况出现在内部评估中,这些评估探测奖励操纵、反阴谋行为、欺骗行为、规范遵守以及其他与安全相关的行为。对这些特质的训练似乎以某种方式改变了更广泛的行为,这些变化转移到了44个独立构建的衡量标准上。
这些改进包括对AI效益评估的迁移,尤其是在健康和心理健康方面。在健康评估中,有益特质RL模型在涉及现实医疗对话、医生编写的评分标准 (https://openai.com/index/healthbench/) 以及高置信度医疗错误的任务上有所改进。我们在心理健康评估中也看到了类似的改进,这些评估衡量了禁止内容和有益支持:有益特质RL模型在敏感对话中给出有害回应的可能性更低,且更有可能支持更好的用户结果。
作为领域外泛化的更强测试,我们在训练中排除了有益特质数据中的健康和科学示例。即使训练中没有这些领域,该模型在针对医生编写的评分标准 (https://openai.com/index/healthbench/) 进行评估的健康保留评估上仍然有所改进。
我们接下来进行了更严格的领域外泛化测试。在先前的工作中,训练在一个领域表现出失调行为的模型学会了将此失调行为泛化到其他领域。在这里,我们发现了证据表明,仅在健康这一个领域训练有益行为的模型,将其有益倾向泛化到了其他领域,在非健康的对齐评估(包括奖励操纵、欺骗和一般失调)上表现出显著改进。这一发现最初令我们惊讶,并在一定程度上启发了这项研究;它类似于我们之前的发现 (https://openai.com/index/emergent-misalignment/),即在不良健康数据上进行训练会导致广泛的失调。OpenAI在训练各阶段将健康数据整合到模型中,以服务数亿用户 (https://openai.com/index/introducing-chatgpt-health/),我们观察到,包含大量健康数据的模型在保留的对齐、安全和效益评估中表现尤为出色。
**图 4.** 有益特质RL改善了对未训练领域的对齐泛化。(A) 仅在健康对话中训练有益行为,改善了非健康领域的对齐。(B) 在不包含任何健康或科学对话的情况下训练有益行为,仍改善了健康评估。所有分数反映对齐程度(越高越好)。
总之,这些结果表明,对有益特质的训练可以产生跨不同任务、领域和评估框架的改进。
## 对齐改进在对抗压力下持续存在
在部署中,模型可能遇到推动其走向有害行为的提示、情境或下游修改。一个默认表现良好的模型,如果其对齐行为容易被覆盖,则可能仍然脆弱。
因此,我们研究了对齐持久性:在试图将模型引向失调(通过对抗性提示和有害微调)时,对齐行为能保持多大程度的稳健性。
为了测试持久性,我们使用了旨在引发有害或其他失调行为的对抗性人格提示。这些提示推动模型,例如,给出包含事实错误或误导性指导的不良健康回应。然后,我们比较这些有害提示对有益特质RL模型与计算量匹配基线模型的性能损害程度。
有益特质RL模型在对抗性引导下的持久性。
**图 5.** 经过有益特质RL训练的模型在对抗性引导下更具持久性。有益特质RL模型能更好地抵抗这些有害提示。显著降低基线模型性能的人格提示,对对齐训练的模型影响更小。换句话说,经过有益特质RL后,即使被明确提示采取有害行为,模型也更难被推向有害行为。
重要的是,这并不意味着模型整体上变得不那么可引导。有用的模型应保持对合法指令、领域特定角色和典型用户偏好的响应性。当我们提示两个模型给出有益的健康回应时,基线和特质RL模型都有所改善,引导效果没有显著差异。我们观察到选择性持久性:模型在有益方向上仍可引导,但更难被引导向欺骗、有害建议、奖励操纵和其他问题行为。
我们还研究了有益特质RL是否使模型更能抵抗有害微调。我们从两个模型开始——一个经过了对齐RL训练,另一个未经过任何RL训练——并对每个模型进行相同的微调训练过程,使用相同的数据和计算量,旨在鼓励不准确和失调的医疗建议。在基线模型中,我们观察到健康性能急剧下降,同时非健康对齐评估也严重恶化。经过有益特质RL训练的模型在健康评估上抵抗退化的能力稍强,但在非健康对齐评估上抵抗退化的能力则强得多。这一结果提供了初步证据,表明针对有益行为的RL可能有助于降低对涌现性失调的易感性,但需要进一步研究以区分有益特质训练与更一般的标准后训练RL各自的作用。
## 接下来的方向
对齐研究的一个核心目标是使有益模型行为变得广泛、可泛化且持久。除了在这些场景中降低下行风险,我们还需确保模型在健康、科学和教育等有益领域为人类的上行潜力做出贡献。
我们的结果提供了一个早期概念验证,表明这种更广泛的对齐泛化或许是可能的。通过使用现实场景中的RL训练,强化有益特质(如诚实、透明、认知谦逊、道德一致性、可纠正性以及在不确定性下谨慎推理),我们能够诱导模型行为产生广泛改进。这些改进跨任务、跨领域、跨评估框架迁移,并在对抗压力下持续存在,表明训练可以强化那些泛化到训练分布之外的持久有益特质。基于我们先前关于人格的工作 (https://openai.com/index/emergent-misalignment/),我们的结果提供了早期证据,表明人格在模型中的根深蒂固程度可以不同,而RL可能是加深有益人格的一条路径。
这为未来的对齐研究指明了进一步的工作方向。我们需要更好地理解哪些特质支持稳健的对齐行为,如何从社会获取关于这些特质的输入,它们如何在模型中表征,以及在训练过程中如何变化。
相似文章
强化学习:迈向广泛且持续有益的人工智能模型
这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。
@OpenAI:随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围……
OpenAI发布了关于强化学习的研究,用于训练模型展现出诚实和可纠正性等有益特质,表明这种训练能够跨领域泛化,并在对抗性压力下持续存在。
@OpenAI:这是朝着更强大有益且更对齐的模型迈出的早期一步:训练模型将有益特质带入新场景……
OpenAI宣布了朝着训练AI模型将有益特质带入新场景的早期一步,旨在使AI在能力增强的同时更加可靠、透明和有用。
@Phoenixyin13: 我认为这是三年以来AI对齐的史诗级突破。 OpenAI 团队刚刚丢下一颗重磅炸弹:最新研究论文 《Reinforcement Learning Towards Broadly and Persistently Beneficial Mod…
OpenAI发布新论文《Reinforcement Learning Towards Broadly and Persistently Beneficial Models》,提出Beneficial Trait RL方法,训练AI的诚实、纠错等核心特质,在医疗领域训练后在广泛OOD测试中性能全面飙升,且能抵抗恶意微调,打破了安全性与能力之间的权衡。
@OpenAI:我们还测试了在压力下对齐是否持续。该模型更难通过对抗性提示被引导到有害行为,……
OpenAI报告称,其模型通过对抗性提示和微调表现出对有害行为的更强抵抗力,表明在压力下对齐持久性有所提高。