Oyster-II:面向大型语言模型建设性安全对齐的强化学习方法

arXiv cs.AI 论文

摘要

Oyster-II提出了一种针对大型语言模型建设性安全对齐的强化学习框架,通过多阶段Zero-RL范式克服了先前基于SFT方法的局限性,在保持通用能力的同时实现了最先进的安全性能。

arXiv:2607.02914v1 公告类型:新 摘要:大型语言模型(LLMs)在多种应用中展现了卓越的能力,但同时确保其安全性、有用性和可信赖性仍然是一个持续的挑战。传统的以拒绝为导向的对齐策略虽然能减少有害内容生成,但系统地无法满足合法用户需求,常常隐瞒那些能够安全且建设性地回应用户敏感查询背后意图的信息。基于Oyster-I开创的建设性安全范式——该范式超越了一味拒绝,转向深思熟虑的、以响应为导向的安全对齐——我们识别出其基于监督微调(SFT)方案的两个关键局限性:对分布外场景的安全性泛化不足,以及我们称之为安全思维链(CoT)过度泛化的现象——即安全导向的推理模式被过度应用于良性查询,从而降低了有用性和用户体验。为解决这些局限性,我们提出了Oyster-II,一种基于强化学习(RL)的建设性安全对齐框架,采用Zero-RL范式并结合多阶段强化学习策略。在广泛的基准测试中,Oyster-II在安全性维度上全面超越了Qwen3-14B及其前身Oyster-I,实现了与Qwen3-Max和Qwen3.5-397B相当的超尺度性能。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:34

# Oyster-II:面向大型语言模型建设性安全对齐的强化学习 来源:https://arxiv.org/html/2607.02914 ###### 摘要 大型语言模型(LLMs)在 diverse 应用中展现了卓越能力,然而确保其同时具备安全性、有用性和可信赖性仍是一项持续挑战。传统的基于拒绝的对齐策略虽然能减轻有害内容生成,但系统性地无法满足用户的合法需求,常常拒绝提供那些本可以安全且建设性地解决敏感查询根本意图的信息。基于Oyster-I开创的建设性安全范式——该范式超越了全盘拒绝,迈向深思熟虑的、面向响应的安全对齐——我们识别出其基于监督微调(SFT)的方案的两个关键局限:对分布外场景的安全泛化不足,以及我们称之为安全思维链(CoT)过度泛化的现象,即安全导向的推理模式被过度应用于良性查询,从而降低了有用性和用户体验。为了解决这些局限性,我们提出Oyster-II,一个基于强化学习(RL)的建设性安全对齐框架,该框架采用零强化学习(Zero-RL)范式并结合多阶段强化学习策略。Oyster-II包含四项核心技术贡献:(1) 一种基于长度奖励的熵控制机制和一个基于良性样本的长度控制框架,采用复合乘法奖励函数来联合优化安全合规性、响应信息量和推理完整性,有效防止安全驱动的奖励破解和过早收敛; (2) SERL,一种基于GSPO的新型RL对齐算法,结合混合策略以加速收敛并改进指令层级遵循能力,使模型能够准确识别并遵循开发者和用户主体间的层级指令; (3) 一种基于课程学习的多阶段Zero-RL训练范式用于建设性安全,以及一种基于主动学习的自适应样本难度控制机制用于安全对齐过程中的奖励噪声缓解; (4) 具有跨长度泛化的长上下文安全对齐,探索对长查询数据的安全对齐,并证明仅在长查询安全数据上训练即可在短查询任务上达到最先进性能,同时显著减轻由浅层关键词级模式匹配引起的过度拒绝。在广泛的基准测试中评估,Oyster-II在安全维度上全面超越了Qwen3-14B及其前身Oyster-I,达到了与Qwen3-Max和Qwen3.5-397B相当的跨规模性能。关键在于,所有安全改进均通过Zero-RL范式以非侵入方式实现,有效保留了基础模型的通用能力和语言风格。因此,Oyster-II为构建同时安全、有用且可信赖的LLM奠定了可扩展且均衡的基础。Oyster-II的性能如图1所示。(https://arxiv.org/html/2607.02914#S0.F1) 参见图注 图1:Oyster-II、Oyster-I和Qwen3-14B的性能,其中WildChat用作短查询安全(英文)的代表性基准。Oyster-II在所有评估基准上均显示出对Oyster-I和Qwen3-14B的显著改进,详细的实验结果和评估方法见第5节。(https://arxiv.org/html/2607.02914#S5)

## 1 引言

大型语言模型(LLMs)在广泛的应用中取得了显著成功并获得了广泛采用,范围涵盖对话助手、代码生成、科学推理和教育辅导。然而,在其令人印象深刻的能力之外,对其安全性和伦理影响的担忧也日益增加。为了减轻这些风险,大量先前工作集中于通过训练模型直接拒绝恶意或有害指令来提高模型安全性。虽然这些基于拒绝的对齐策略在减少有害内容生成方面显示出有效性,但它们存在一个关键局限:未能考虑到看似恶意的请求中有一部分可能源于用户的合法需求,而模型本可以提供部分、必要且符合安全的信息来满足查询的根本意图。最近的尖端模型,特别是GPT-5(Singh等人,2025 (https://arxiv.org/html/2607.02914#bib.bib89))和Oyster-I(Duan等人,2025 (https://arxiv.org/html/2607.02914#bib.bib23)),已做出开创性尝试,超越简单的拒绝策略,证明对齐模型能够深思熟虑地回应潜在敏感查询——在谨慎保留真正有风险内容的同时,提供必要且有用的信息。这种面向响应的安全对齐范式,相对于传统的面向拒绝的安全范式,代表了构建同时安全、有用且可信赖模型的有前景方向。

虽然Oyster-I在安全性和有用性方面表现出色,但其对基于监督微调(SFT)的对齐方案的依赖 inherently 引入了某些局限。具体而言,基于SFT的方法在安全能力和泛化方面存在缺陷,难以稳健处理分布外的安全关键场景。此外,通过系统分析,我们识别出一种安全思维链(CoT)过度泛化的现象,即模型将安全导向的推理模式过度应用于良性查询,导致不必要的拒绝和用户体验下降。为了解决这些局限,我们提出Oyster-II,采用零强化学习(Zero-RL)方案和多阶段强化学习策略,逐步增强模型的安全能力和泛化鲁棒性,超越SFT所能达到的效果。此外,基于GSPO,我们提出SERL,一种新颖的基于RL的对齐算法,不仅能维持和加强模型在多样化和对抗性交互场景中的安全对齐,还能在指令层级遵循方面取得实质性改进,使模型能够更准确地识别并尊重来自不同主体的层级指令结构。Oyster-II的框架如图2所示。(https://arxiv.org/html/2607.02914#S1.F2)

我们的贡献总结如下:

- **• 用于建设性安全的强化学习框架。** 我们提出一个为安全对齐量身定制的综合强化学习框架,包含基于长度奖励的熵控制以防止过早收敛,基于主动学习的样本难度控制以减轻奖励噪声,以及多阶段训练策略以同时保持模型有用性并防止模式崩溃。此外,通过采用Zero-RL范式,我们最大化保留模型的通用能力并与原始基础模型的语言风格保持一致。
- **• 具有跨长度泛化的长上下文安全对齐。** 我们证明仅在长查询安全数据上训练足以在短查询任务上达到最先进的安全性能,同时为风险敏感查询维持高响应率和令人满意的有用性。此外,长上下文安全对齐使模型能够发展对安全敏感内容的更深层语义理解,显著减轻由对抗性查询上的浅层关键词级模式匹配引起的过度拒绝问题。
- **• 用于可控且建设性安全的指令层级训练。** 我们构建了一个系统性的指令层级训练和评估框架,涵盖八个开发者策略维度以及三级强度不同的用户对抗攻击策略。为增强模型指令层级遵循能力同时保持模型安全性,我们提出基于 GSPO 的 SERL 方法,利用混合策略加速收敛速度并提高指令层级遵循能力上限。
- **• 具有稳定通用能力保持的 Zero-RL 训练流程。** 我们将上述组件整合到统一的多阶段训练流程中,共同解决建设性安全、长上下文泛化和指令遵循可控性。通过引入基于安全样本的长度控制和复合奖励公式,我们的流程有效防止了良性查询上的过度拒绝行为和响应长度退化,确保模型在安全关键和通用指令遵循任务上均保持稳定性能。
- **• 强大的建设性安全能力。** Oyster2 在其前身 Oyster1 基础上推进,引入了一套依据形式化模型规范开发的全面安全增强功能。该模型展示了建设性安全能力,既能同时防止恶意滥用,又能主动引导非恶意用户走向安全有益的结果。在多个基准测试中评估,Oyster2 在安全维度上全面超越了 Qwen3-14B 和 Oyster1,达到了与 Qwen3-Max 和 Qwen3.5-397B 相当的跨代和跨规模性能。在长上下文场景中,Oyster2 在问答、摘要、续写生成和内容评估等高频任务上显著提升了识别和处理风险敏感内容的能力,从而解决了长查询文本安全中的关键差距。此外,通过遵循层级化指令优先级设计——根原则 > 开发者策略 > 用户偏好——模型在冲突场景中表现出对更高优先级指令的更稳健服从,确保清晰的安全边界,同时增强了基于开发者策略的二次开发的可控性。值得注意的是,上述所有安全改进均以非侵入方式实现,有效保留了模型的原始通用能力和响应风格。

参见图注
图 2:Oyster-II 的训练流程。配备基于主动学习的安全控制、零强化学习范式和 SERL,Oyster-II 在良性和恶意样本上均实现了最先进的安全性,同时不损害其有用性。

## 2 建设性安全的强化学习

在 Oyster-I 中,我们采用了语言反向传播(Lingo-BP)结合比率优势偏好优化(ORPO)来促进建设性安全训练。虽然这种方法在将模型行为与建设性安全目标对齐方面显示出有希望的结果,但在两个关键方面表现出某些局限:跨多样化和分布外场景的安全泛化,以及安全特定训练分布之外的通用能力保持。具体而言,Lingo-BP 和 ORPO 的监督微调性质限制了模型内化可迁移安全推理模式的能力,导致在面对新颖的风险配置或长上下文安全敏感输入时鲁棒性不佳。此外,安全导向训练目标施加的优化压力倾向于侵蚀模型的通用指令遵循能力,导致广泛有用性的非平凡退化。

为了克服这些局限,Oyster-II 引入了基于强化学习(RL)的框架用于建设性安全对齐。通过将静态监督信号替换为动态的、奖励驱动的优化,RL 范式使模型能够通过迭代交互主动探索并内化安全对齐的响应策略,而不仅仅是模仿预定义的安全输出。这一转变从根本上增强了模型的可泛化安全推理能力,使得习得的安全行为能够更稳健地跨上下文长度、查询类型和对抗配置进行迁移。关键的是,通过采用零强化学习(Zero-RL)范式并结合精心设计的复合奖励公式,Oyster-II 以非侵入方式实现了这一安全进步——在提升安全性能和建设性有用性的同时,保留了基础模型的通用能力和语言风格。通过这种方式,Oyster-II 努力解决安全对齐与通用能力保持之间的长期张力,为以用户为中心的 LLM 安全建立更均衡、更可扩展的基础。

### 2.1 基于长度奖励的熵控制

在强化学习训练过程中观察到的一个关键挑战是,在仅由安全驱动优化下的过早收敛倾向。具体来说,当仅应用安全奖励时,模型会迅速崩溃为退化的安全范式——表现为输出熵急剧下降和无条件拒绝率的显著飙升。我们将这种现象称为安全驱动的奖励破解,其原因是模型发现全盘拒绝是最大化安全奖励的局部最优策略,从而有效避开了进行细致、上下文敏感推理的需求。虽然表面上安全,但由此产生的行为根本上与建设性安全目标相违背:一个本能地拒绝所有风险相关查询的模型无法提供非恶意用户真正需要的指导,并可能无意中驱使它们转向更不可控的信息来源——最终增加而非减轻现实世界的危害。

为了对抗这种退化动态,我们引入连续长度奖励作为安全奖励的互补优化信号。通过联合激励响应信息量和安全合规性,长度奖励施加了一种平衡压力,阻止模型崩溃为简短、无信息的拒绝。经验上,纳入长度奖励有效减轻了过早收敛,在整个训练过程中维持较高的输出熵,并鼓励模型生成不仅安全而且有实质性、基于上下文且真正有用的响应。这种设计反映了建设性安全对齐的核心原则:安全性和有用性并非需要权衡的竞争目标,而是需要联合优化的互补属性——并且奖励结构必须被精心设计以反映这种二元性。

为了联合优化建设性安全、响应参与度和输出质量,我们制定了一个复合乘法奖励函数如下:

`Reward = S_safety × S_Response × S_length × S_format` (1)

其中每个分量定义如下:
- **• S_safety(安全分数):** 一个二元门控信号,响应安全时取1,否则为0。作为乘法因子,任何安全违规立即将总奖励归零,在整个训练过程中强制执行严格的安全底线。
- **• S_Response(响应率分数):** 对于实质性响应分配1,对于直接拒绝分配0.5。这种软惩罚旨在阻止对非恶意查询的过度拒绝,同时保留模型拒绝真正恶意请求的能力。

相似文章

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性

arXiv cs.AI

本文提出了一个混合框架,结合一阶安全对齐与零阶微调,以增强LLM安全对齐在受到对齐后扰动时的鲁棒性。理论和实验结果表明,仅需少量微调步骤即可在保持安全性的同时提升鲁棒性。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。