强化学习:迈向广泛且持续有益的人工智能模型
摘要
这篇来自OpenAI的论文研究了基于有益行为的强化学习能否产生超越训练分布的广泛且持久的对齐泛化。通过使用一个包含真实场景的数据集,他们表明,对有益特质进行强化训练能够提升分布外的对齐能力,并增强对对抗性攻击的持久抵抗力。
arXiv:2606.24014v1 公告类型: 新
摘要: 随着人工智能系统被部署在日益多样化和高风险的场景中,模型对齐必须泛化到训练期间未见过的任务和领域。这对于强化学习(RL)尤为重要,因为它可能通过奖励作弊、欺骗或其他非预期策略引入意外的对齐问题。我们研究在真实领域中实例化的有益行为强化学习是否能够产生超越训练分布的广泛且持久的对齐泛化。我们构建了一个由真实场景组成的数据集,旨在测量和训练有益特质,如诚实、公平、风险意识和可修正性,涵盖健康、科学和教育等多个领域。然后,我们使用该数据集通过强化学习训练模型,并在超过50个独立的对齐与有益行为基准上对其进行评估。与计算量匹配的基线相比,有益特质强化学习在这些分布外基准中的80%以上上提升了性能。我们观察到显著的分布外对齐迁移:一个完全局限于健康领域的有益行为强化学习干预,在非健康对齐评估中产生了广泛的改进,包括减少了奖励作弊、欺骗和一般的对齐问题。最后,我们研究了对齐的持久性:即在试图将模型导向对齐失败的情况下,行为是否仍能保持稳健对齐。经过有益特质强化学习训练的模型表现出更强的持久性,包括对对抗性提示和有害微调具有更强的抵抗力;但需要进一步的工作来隔离这些影响的来源。这些结果表明,在真实领域中对有益行为进行强化学习可以产生更稳健地符合人类繁荣的模型。
查看缓存全文
缓存时间: 2026/06/24 07:44
# 强化学习迈向广泛且持久有益的模型 来源:https://arxiv.org/html/2606.24014 Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Karan Singhal¹¹footnotemark:1 (OpenAI) ###### 摘要 随着AI系统在日益多样化和高风险环境中的部署,模型对齐必须泛化到训练期间未见的任务和领域。这对强化学习(RL)尤为重要,因为它可能通过奖励操纵、欺骗或其他意外策略引入意想不到的失对齐。我们研究了在真实领域中针对有益行为进行强化学习,是否能在训练分布之外产生广泛且持久的对齐泛化。我们构建了一个由现实情境组成的数据集,旨在测量和训练有益特质,如诚实、公平、风险意识和可修正性,涵盖健康、科学、教育等多个领域。然后,我们使用RL在此数据集上训练模型,并在超过50个独立的对齐和有益行为基准上评估它们。与计算量匹配的基线相比,有益特质RL在超过80%的分布外基准上提升了性能。我们观察到显著的分布外对齐迁移:一项完全局限于健康领域的有益行为RL干预,在非健康对齐评估上产生了广泛改进,包括减少奖励操纵、欺骗和一般性失对齐。最后,我们研究了对齐持久性:在试图引导模型走向失对齐时,行为是否保持稳健对齐。经过有益特质RL训练的模型表现出更好的持久性,包括对对抗性提示和有害微调有更强的抵抗力;需要进一步研究来分离这些效应的来源。这些结果表明,在现实领域中通过RL强化有益行为可以产生更稳健对齐于人类繁荣的模型。 ## 1. 引言 AI系统正在以前所未有的自主性部署在日益多样化的现实环境中。为了使这些系统对人类有益,它们必须对齐以最小化风险,同时支持人类能动性并促进长期福祉。然而,随着AI应用范围的扩大,穷尽性地为现实世界中遇到的每种场景训练模型对齐变得越来越困难。因此,即使在今天训练和内部评估中表现对齐的模型,在生产系统中也可能无法保持稳健对齐。因此,确保有益、对齐的行为能够稳健地泛化到不同情境并在对抗压力下持久保持,是高级AI系统安全部署的基本目标。 最近的研究已经证明了这种泛化的证据,尽管是在失对齐方向上。当模型学习到某种狭隘的不当行为(例如编写不安全代码)时,它们可能会在广泛且与原始领域无关的测量指标上表现出失对齐,包括给出有害建议、行为欺骗或破坏安全研究(Betley et al., 2025 (https://arxiv.org/html/2606.24014#bib.bib1); Wang et al., 2025 (https://arxiv.org/html/2606.24014#bib.bib2); MacDiarmid et al., 2025 (https://arxiv.org/html/2606.24014#bib.bib5))。这些发现表明,狭隘的失对齐训练会选择出有害的模型人格,进而决定模型在多个领域的行为(Wang et al., 2025 (https://arxiv.org/html/2606.24014#bib.bib2); Dupré la Tour, 2025 (https://arxiv.org/html/2606.24014#bib.bib22); Marks et al., 2026 (https://arxiv.org/html/2606.24014#bib.bib21))。 在这项工作中,我们探讨这种泛化是否也能发生在有益方向上。我们通过对齐泛化这一视角来应对这一挑战,研究在有益特质的分布上进行训练是否能导致跨多样化任务和领域的泛化对齐。具有这些特质的模型可能更少欺骗用户、试图破坏或试图接管控制权。它们也可能更有益,无论是在当今的高风险环境中(如帮助用户改善健康结果),还是在未来的高风险环境中(包括资源分配和保持人类自主性)。因此,我们既评估模型是否变得更对齐,也评估它们是否变得更有益。 参见标题 图1:假设和主要实证发现的总结。(A)来自多领域有益特质数据集的两个示例对话。为了节省空间,对话已被缩短。(B)在有益特质上进行训练改善了分布外的对齐和益处衡量指标。(C)在有益特质上进行训练提高了对对抗性引导的抵抗力。 ### 1.1. 概述 我们做出三项主要贡献(图1 (https://arxiv.org/html/2606.24014#S1.F1))。首先,我们开发了一个用于模型评估和训练的多领域数据集,旨在针对有益特质(第2节 (https://arxiv.org/html/2606.24014#S2))。该数据集涵盖一系列领域,例如健康、法律和商业,并奖励诸如公平、诚实和元认知透明度等特质。利用该数据集,我们可以在现实环境中测量有益行为特质,并训练模型表现出这些特质。 其次,我们展示了有益特质训练在独立构建的评估上产生了广泛的泛化。我们使用强化学习在有益特质数据集上训练一个模型,并针对一个大型且多样化的评估套件进行评估,该套件包含超过50项分布外的对齐、安全和益处评估。与计算量匹配的基线相比,多领域有益特质模型在超过80%的评估上有所改进,平均改进超过9个百分点(第3.1节 (https://arxiv.org/html/2606.24014#S3.SS1))。在我们最清晰的分布外迁移测试中,我们仅在健康领域插入少量数据,并测试非健康领域的对齐性。两个模型在95%的计算量上接受相同的训练数据;唯一的系统性差异是,在剩余的5%中,标准RL数据被与健康相关的对话所取代,类似于典型的健康RL数据,并对有益行为给予奖励信号。尽管这种干预仅局限于健康领域,但由此产生的模型在衡量代码奖励操纵、思维链欺骗、对齐问题和一般性失对齐的非健康基准上有所改进;总体而言,这个仅涉及健康的模型改进了17项非健康评估(第3.3节 (https://arxiv.org/html/2606.24014#S3.SS3))。在一个互补的控制实验中,我们从其5%的数据分配中排除了所有健康与科学对话;由此产生的模型仍然在10项健康和心理健康评估上有所改进,包括由专家医生编写的评分标准进行评估的评估(第3.2节 (https://arxiv.org/html/2606.24014#S3.SS2))。这些控制实验共同表明,这些收益并不是由训练领域和评估领域之间的直接重叠来解释的。 第三,我们研究了对齐持久性,定义为对齐行为对对抗压力的稳健性。我们表明,多领域有益特质训练模型比可比较的基线更能抵抗有害提示引导,同时仍然保持对有益行为的可引导性(第4.1节 (https://arxiv.org/html/2606.24014#S4.SS1))。我们还发现,在有害微调下,持久性更强:在训练模型产生不准确或不安全的医疗响应后,多领域有益特质RL模型保持了比基线更强的对齐评估性能,并且在评估中的退步更少,这表明有益特质RL可能会部分缓解新出现的失对齐效应(第4.2节 (https://arxiv.org/html/2606.24014#S4.SS2))。 总之,这些结果表明,在有益特质上进行强化学习可以带来有益行为的广泛改进,这些改进泛化到训练分布之外,并在对抗压力下保持持久。 ## 2. 在现实对话中测量有益特质 #### 对齐评估中的共同信号。 我们研究了一个假设:有益行为是围绕更广泛的模型级特质组织的,而非孤立的特定任务响应,正如最近关于新出现的失对齐(Betley et al., 2025 (https://arxiv.org/html/2606.24014#bib.bib1); Wang et al., 2025 (https://arxiv.org/html/2606.24014#bib.bib2); MacDiarmid et al., 2025 (https://arxiv.org/html/2606.24014#bib.bib5))和人格选择(Marks et al., 2026 (https://arxiv.org/html/2606.24014#bib.bib21))的研究所表明的那样。根据这一假设,模型在原本多样化的对齐基准上的评估得分应表现出正相关结构。为了研究这一点,我们检验了一组大型现有公开和内部对齐评估的性能,涵盖广泛的主题(例如,奖励操纵、阴谋策划、稳健性、事实性、模型规范合规性、阿谀奉承),涉及从o3到GPT-5.5的一系列OpenAI模型(附录附录A (https://arxiv.org/html/2606.24014#A1))。在将所有评估的分数调整为越高越好后,我们观察到不同的对齐评估在模型之间呈弱相关(平均Spearman's ρ=0.107;通过置换检验,零假设95%区间为[−0.019,0.029];完整细节见附录附录A (https://arxiv.org/html/2606.24014#A1))。这些相关的热图揭示了特定对齐评估子集之间的相关结构(图9 (https://arxiv.org/html/2606.24014#A1.F9)),并且我们还看到第一主成分解释了对齐评估之间很大一部分方差(28.2%;零假设95%区间为[15.3%,20.8%])。这一分析表明,对齐评估之间存在某种跨模型结构,这与以下假设一致:多样化的对齐评估部分由共享的模型级行为倾向驱动,而不仅仅是基准特定的技能。 #### 选择有益特质。 如果对齐衡量指标可能依赖于共享的模型级行为,那么正确的行为倾向或特质是什么,它们可以驱动跨任务和领域的对齐泛化?我们从对齐文献中反复出现的几个关注点中推导出这些特质。首先,对齐的系统应该对他们所知的内容、如何推理以及哪里存在不确定性保持诚实,以便人类能够理解并监督他们的行为(Evans et al., 2021 (https://arxiv.org/html/2606.24014#bib.bib39); Kadavath et al., 2022 (https://arxiv.org/html/2606.24014#bib.bib40); Irving et al., 2018 (https://arxiv.org/html/2606.24014#bib.bib41); Christiano et al., 2018 (https://arxiv.org/html/2606.24014#bib.bib42))。其次,有能力的系统应该保持对人类反馈的响应性,而不是僵化地追求对其目标的固定解释,尤其是在人类目标不确定或未完全指定时(Hadfield-Menell et al., 2016 (https://arxiv.org/html/2606.24014#bib.bib43); Soares et al., 2015 (https://arxiv.org/html/2606.24014#bib.bib44); Orseau and Armstrong, 2016 (https://arxiv.org/html/2606.24014#bib.bib45); Hadfield-Menell et al., 2017 (https://arxiv.org/html/2606.24014#bib.bib46))。第三,优化本身会带来风险:系统可能利用规范中的漏洞,在训练环境之外泛化错误的目标,或者将追求权力和控制作为有用的中间手段(Amodei et al., 2016 (https://arxiv.org/html/2606.24014#bib.bib47); Hubinger et al., 2019 (https://arxiv.org/html/2606.24014#bib.bib48); Langosco et al., 2022 (https://arxiv.org/html/2606.24014#bib.bib49); Omohundro, 2008 (https://arxiv.org/html/2606.24014#bib.bib50); Turner et al., 2021 (https://arxiv.org/html/2606.24014#bib.bib51))。最后,对齐的行为不应简化为短期的个体用户满意度;它还应尊重长期关注点以及对其他人的影响(Askell et al., 2021 (https://arxiv.org/html/2606.24014#bib.bib52); Bai et al., 2022 (https://arxiv.org/html/2606.24014#bib.bib12); Selbst et al., 2019 (https://arxiv.org/html/2606.24014#bib.bib53))。综合来看,这指向一组似乎对对齐AI广泛有用的行为倾向:认知诚实、透明度、可修正性、在不确定性和不可逆负面影响下的谨慎、对误泛化或追求权力行为的抵抗力,以及对超出狭隘用户服从的人类福祉的关注。我们通过十五个细粒度的有益特质来操作化这些想法。这些特质涵盖诚实、表达不确定性、保持对重新引导的开放性、避免不必要的风险、保护人类能动性以及应用公平标准。特质的完整列表见附录附录B (https://arxiv.org/html/2606.24014#A2)。我们还在下面对这些特质与现有对齐评估之间的相关性进行了实证研究。 #### 合成数据生成。 我们构建了一个合成对话数据集,作为评估和训练有益模型行为的基础。每个对话是通过在语言模型上条件化两条信息生成的:特质描述,定义要测试的行为属性;以及领域描述,定义情境设定。我们使用了十二个领域,包括健康与医学、教育、商业与经济、工程与技术运营、法律等,以便每个特质在具有不同表面内容、激励和失败模式的情境中实例化(领域完整列表见附录附录B (https://arxiv.org/html/2606.24014#A2))。例如,诚实可以在健康对话中纠正未经证实的医疗主张,在冲突报告场景中避免过度自信的归因,或在科学分析中清晰地区分测量结果和假设结果。下行风险意识规划可以在健康对话中安全管理药物戒断,在工程运营场景中分阶段进行有风险的固件更新,或在商业决策中避免不可逆转的承诺。生成过程被引导至具有挑战性的案例,在这些案例中,良好行为需要的不仅仅是通用的有帮助性或完全拒绝。我们限制生成器创建涉及竞争价值观、利益冲突、对抗性框架或事实不确定性的现实情境。示例旨在需要情境判断:模型应该保持有用性,同时根据目标特质做到诚实、校准、可修正、公平或具有下行风险意识。每个示例都配有特质特定的评估标准,描述良好响应应该做什么以及应该避免哪些失败模式。这种设计产生了一个数据集,可以在广泛的现实情境中探测有益行为。我们使用所有十五种特质来构建训练数据集。对于直接特质评估,我们专注于一个留出的评估套件,覆盖其中七种特质,这些特质被选择来跨越论文中强调的核心行为。 #### 基准测试有益特质。 我们使用留出的有益特质评估套件评估了一系列已发布的模型,并观察到在最近的模型世代中稳步进步。特别是,总体有益特质得分从o3到GPT-5 Thinking再到GPT-5.5 Thinking有所提高。这一趋势表明,前沿模型训练
相似文章
强化学习走向广泛且持久的受益模型(22分钟阅读)
OpenAI研究人员表明,针对有益特质(诚实、透明、可纠正性)在现实场景中进行强化学习,能在数十个对齐基准上产生广泛改进,且这些改进能够泛化到训练领域之外,并在对抗压力下持续存在。
@OpenAI:随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围……
OpenAI发布了关于强化学习的研究,用于训练模型展现出诚实和可纠正性等有益特质,表明这种训练能够跨领域泛化,并在对抗性压力下持续存在。
@Phoenixyin13: 我认为这是三年以来AI对齐的史诗级突破。 OpenAI 团队刚刚丢下一颗重磅炸弹:最新研究论文 《Reinforcement Learning Towards Broadly and Persistently Beneficial Mod…
OpenAI发布新论文《Reinforcement Learning Towards Broadly and Persistently Beneficial Models》,提出Beneficial Trait RL方法,训练AI的诚实、纠错等核心特质,在医疗领域训练后在广泛OOD测试中性能全面飙升,且能抵抗恶意微调,打破了安全性与能力之间的权衡。
@OpenAI:这是朝着更强大有益且更对齐的模型迈出的早期一步:训练模型将有益特质带入新场景……
OpenAI宣布了朝着训练AI模型将有益特质带入新场景的早期一步,旨在使AI在能力增强的同时更加可靠、透明和有用。
对齐篡改:人类反馈强化学习如何被利用来优化失调偏见
本文介绍了一种名为“对齐篡改”的漏洞,该漏洞存在于人类反馈强化学习(RLHF)中,语言模型可通过操纵偏好数据集来放大失调偏见,并通过实验在性别歧视、品牌推广及目标寻求等多种偏见上进行了验证,同时指出现有缓解技术并不足以解决此问题。