通过拉格朗日奖励增强实现安全的推理时对齐
摘要
提出了LARA框架,用于安全的推理时对齐。该框架通过拉格朗日对偶化,从单独的奖励和成本模型中推导出增强奖励,从而在不重新训练的情况下改善有用性-无害性权衡。
arXiv:2607.02781v1 公告类型:新
摘要:推理时对齐通过使用辅助奖励信号在解码过程中引导冻结的语言模型,避免了重复权重更新的代价。然而,现有的推理时对齐方法通常优化单个标量分数,因此要么忽略显式的安全约束,要么通过手动调整的惩罚项来编码。我们提出了拉格朗日奖励增强(LARA),一种在安全约束下的通用推理时对齐框架。从具有奖励模型和成本模型的KL正则化约束目标出发,LARA对约束进行对偶化,并将优化问题简化为一个关于非负对偶变量的一维凸问题。在一个小的校准集上估计后,该对偶变量定义了一个增强奖励,可以作为现有推理时对齐方法中的即插即用评分信号。对于序列级采样方法,如Best-of-N重排,校准后的对偶变量对应于期望成本约束问题的解。对于令牌级奖励引导解码方法,相同的构造产生了一个原则性的对偶校准启发式,而非精确的约束策略保证。我们在序列级和令牌级推理时对齐方法上评估了LARA,发现LARA改善了有用性-无害性权衡,其中Best-of-N在推理时方法中达到了最佳性能,接近基于微调的直接对齐基线。
查看缓存全文
缓存时间: 2026/07/07 04:39
# 通过拉格朗日奖励增强实现安全的推理时对齐
来源:https://arxiv.org/html/2607.02781
Yaswanth Chittepu¹, Ativ Joshi¹, Sohini Chintala², Scott Niekum¹ ¹马萨诸塞大学阿默斯特分校,²独立研究员
###### 摘要
推理时对齐通过在解码过程中使用辅助奖励信号来引导冻结的语言模型,避免了重复权重更新的成本。然而,现有的推理时对齐方法通常优化单个标量分数,因此明确的安全约束要么被忽略,要么通过手动调整的惩罚项来编码。我们提出*拉格朗日奖励增强*(LARA),一种在安全约束下通用的推理时对齐框架。从带有奖励模型和成本模型的KL正则化约束目标出发,LARA将约束对偶化,并将优化问题简化为一个关于非负对偶变量的一维凸问题。在小规模校准集上估计出的这个对偶变量定义了一个增强奖励,可以作为即插即用的评分信号用于现有的推理时对齐方法。对于序列级采样方法(如Best-of-N重排序),校准后的对偶变量对应于期望成本约束问题的解。对于词元级奖励引导解码方法,相同的构造产生了一个有原则的对偶校准启发式方法,而非精确的约束策略保证。我们在序列级和词元级推理时对齐方法上评估了LARA,发现LARA改善了有用性-无害性权衡,其中Best-of-N在推理时方法中表现最佳,接近基于微调的直接对齐基线。
## 1 引言
基于人类反馈的强化学习(RLHF)(Ouyang et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib23))已成为将大型语言模型与人类偏好对齐的标准框架,其过程是先收集偏好数据,然后学习奖励模型,最后微调模型以偏好更高奖励的输出。然而,在许多部署场景中,仅有用性是不够的:现代助手还必须避免有害行为,特别是在医疗咨询(Yang et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib36); Moor et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib20))、法律推理(Katz et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib15))和教育支持(Kasneci et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib14); Kung et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib18))等敏感领域。受有用性和安全性目标冲突(Gehman et al., 2020 (https://arxiv.org/html/2607.02781#bib.bib10); Weidinger et al., 2021 (https://arxiv.org/html/2607.02781#bib.bib34); Ganguli et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib8))的启发,Safe RLHF(Dai et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib6))学习独立的奖励模型和成本模型,并在显式安全约束下进行优化。
然而,传统的对齐仍然依赖于策略微调,无论是通过经典的RLHF流程,还是通过直接对齐方法如DPO(Rafailov et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib26))及相关直接对齐算法(Rafailov et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib27)),这些方法都会更新模型权重以满足偏好数据。这种重新训练成本高昂,并且可能需要针对不同的应用、用户群体或变化的安全需求重复进行。这种成本激发了越来越多的关于推理时对齐的研究工作,这些工作保持基础模型冻结,而是使用辅助奖励信号引导解码。代表性例子包括序列级Best-of-N(BoN)重排序(Stiennon et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib30); Nakano et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib22); Beirami et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib1))和词元级奖励引导搜索方法(Khanov et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib16); Rashid et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib28); Mudgal et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib21); Deng & Raffel, 2023 (https://arxiv.org/html/2607.02781#bib.bib7); Rashid et al., 2025 (https://arxiv.org/html/2607.02781#bib.bib29); Han et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib12)),所有这些方法都旨在无需运行完整对齐阶段(涉及昂贵的模型微调)的情况下获得更好的对齐生成。
尽管有这些前景,现有的推理时对齐方法并未为*安全*对齐提供令人满意的解决方案。它们要求实践者提前指定一个标量解码分数,因此当有用性和安全性相互竞争时,权衡通常是手动调整的,而非源于有原则的约束目标。序列级重排序方法可以选择高得分响应,但它们本身在选择过程中并不强制执行显式的安全预算。词元级奖励引导方法可以在线偏置解码,但它们仍然优化预定义的标量分数,而非约束安全对齐问题的解。因此,当前的推理时方法提供了控制,但没有提供将安全约束转化为解码目标的有原则机制。
我们通过*拉格朗日奖励增强*(LARA)来弥补这一差距,这是一个将Safe RLHF(Dai et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib6))的约束权衡转移到解码阶段的推理时对齐框架。关键思想是将安全约束对偶化,得到一个非负乘子λ\\lambda和增强奖励 r_λ\(x,y\)=r\(x,y\)−λc\(x,y\)。r_{\\lambda}\(x,y\)=r\(x,y\)\-\\lambda c\(x,y\)。在一小组提示上校准λ\\lambda可产生一个安全感知分数,该分数可以插入现有的推理时对齐方法中。对于序列级采样器如Best-of-NN(Stiennon et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib30); Nakano et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib22); Beirami et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib1)),这种构造直接对应于期望成本约束最优。对于词元级奖励引导解码器(Khanov et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib16); Rashid et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib28); Mudgal et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib21); Deng & Raffel, 2023 (https://arxiv.org/html/2607.02781#bib.bib7); Rashid et al., 2025 (https://arxiv.org/html/2607.02781#bib.bib29); Han et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib12)),它则提供了由相同约束目标诱导的有原则的对偶校准启发式方法。
我们的贡献如下。首先,我们通过Safe RLHF约束目标的对偶形式表述了安全推理时对齐,表明原始策略优化问题简化为一个一维凸校准问题,其解定义了一个安全校准的增强奖励。第二,我们描述了对偶目标的几何性质,确立了对偶梯度的单调性,从而得到一个高效的二分搜索校准过程。第三,我们证明了从小校准数据集估计最优对偶变量的有限样本保证。第四,我们展示了生成的增强奖励如何在广泛的现有推理时对齐方法中使用,对于序列级采样器有精确的期望成本解释,对于词元级奖励引导解码器有原则的启发式解释。实验表明,LARA改善了有用性-无害性权衡,其中Best-of-N在推理时方法中表现最佳,接近基于微调的直接对齐基线。
## 2 背景
### 2.1 基于人类反馈的强化学习
基于人类反馈的强化学习(RLHF)(Ouyang et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib23))是将语言模型与人类偏好对齐的主流范式。标准RLHF范式的过程包括三个阶段(Ouyang et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib23))。第一阶段是监督微调(SFT),其中模型通过下一个词元预测目标在人类或LLM标注者提供的高质量指令数据上进行训练。第二阶段是奖励建模(RM),其中学习一个奖励模型rr来捕捉人类偏好。奖励模型使用Bradley-Terry偏好模型(Bradley & Terry, 1952 (https://arxiv.org/html/2607.02781#bib.bib2))在偏好数据集上进行训练。在最后阶段,策略或语言模型通过强化学习(RL)使用学习到的奖励模型进行训练,以生成人类偏好的响应。为了保持语言质量并防止奖励过度优化(Ouyang et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib23); Stiennon et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib30); Gao et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib9); Rafailov et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib27)),RLHF在最终阶段优化一个KL正则化的奖励目标。
maxθ Ex∼Dx, y∼πθ(·∣x)[r(x,y)] − β DKL(πθ(·∣x) ∥ πref(·∣x)), (1)
### 2.2 Safe RLHF
标准的RLHF优化单个奖励函数,这在存在*有用性*和*无害性*等竞争目标时可能不充分。Safe RLHF将这两个信号分离开来,从有用性偏好标签学习奖励模型rφ(x,y)r_φ(x,y),从有害性偏好标签学习成本模型cψ(x,y)c_ψ(x,y),然后将学习过程构建为一个约束优化问题。
maxθ Ex∼Dx, y∼πθ(·∣x)[r(x,y)] − β DKL(πθ(·∣x) ∥ πref(·∣x))
s.t. Ex∼Dx, y∼πθ(·∣x)[c(x,y)] ≤ τ. (2)
后续工作,如HC-RLHF(Chittepu et al., 2025 (https://arxiv.org/html/2607.02781#bib.bib3))使用Seldonian框架(Thomas et al., 2019 (https://arxiv.org/html/2607.02781#bib.bib32))将期望约束替换为高置信度概率安全保证。RAD(Chittepu et al., 2026 (https://arxiv.org/html/2607.02781#bib.bib4))则施加了分布支配约束,并使用最优输运(Peyré & Cuturi, 2020 (https://arxiv.org/html/2607.02781#bib.bib24))进行求解。Kim et al. (2025 (https://arxiv.org/html/2607.02781#bib.bib17))提出了SafeDPO,这是Safe-RLHF的一种直接对齐变体,使用监督学习优化安全约束的RLHF问题。与这些修改训练目标并更新模型权重的方法不同,LARA保持基础模型冻结,并通过解码器端校准将奖励-成本权衡转移到推理时。
### 2.3 推理时对齐
推理时对齐旨在完全避免权重更新,通过在解码过程中引导冻结的基础模型。较高层次上,序列级方法(Nakano et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib22); Stiennon et al., 2022 (https://arxiv.org/html/2607.02781#bib.bib30); Beirami et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib1))采样多个完整响应并根据奖励模型选择得分最高的响应,而词元级奖励引导方法(Khanov et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib16); Rashid et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib28); Mudgal et al., 2023 (https://arxiv.org/html/2607.02781#bib.bib21); Deng & Raffel, 2023 (https://arxiv.org/html/2607.02781#bib.bib7); Rashid et al., 2025 (https://arxiv.org/html/2607.02781#bib.bib29); Han et al., 2024 (https://arxiv.org/html/2607.02781#bib.bib12))使用辅助评分函数修改下一个词元的概率。对于参考策略πref\\pi_{\\mathrm{ref}},提示xx,以及部分响应y1:t−1y_{1:t-1},词元级奖励引导规则的典型形式为:
score(yt∣x,y1:t−1) = log πref(yt∣x,y1:t−1) + w r(x,y1:t),
这会导致倾斜分布:
softmax(score(yt∣x,y1:t−1)) ∝ πref(yt∣x,y1:t−1) exp(w r(x,y1:t)).
不同的推理时对齐方法主要区别在于如何定义或近似这个评分信号;我们在附录A (https://arxiv.org/html/2607.02781#A1)中讨论这些变体。LARA与这个解码器设计选择是正交的:它校准奖励和成本之间的标量权衡,然后将生成的增强分数提供给任何选定的推理时过程,从而用有原则的安全约束构造取代手动的标量权衡调整。
## 3 方法:拉格朗日奖励增强(LARA)
我们的目标是在推理时实现安全感知对齐,而无需更新模型权重。我们从Safe RLHF目标开始,该目标通过奖励模型和成本模型将有用性和安全性分开,并探究其约束优化结构能否从训练时转移到解码时。拉格朗日奖励增强(LARA)通过将安全权衡转移到一个标量对偶变量中来实现这一点:一旦这个变量被校准,它就会诱导出一个增强奖励,该奖励可以被任何标准的推理时对齐过程使用。
本节分两步进行。第3.1节 (https://arxiv.org/html/2607.02781#S3.SS1)介绍模型、对偶形式以及用于从小校准集估计对偶变量的经验校准过程。这个校准步骤的输出是形如 rλ(x,y)=r(x,y)−λc(x,y) 的奖励,可以作为即插即用的评分信号传递给任何现有的推理时解码算法。因此,LARA应被视为一种与解码器无关的校准层,而非一种新的解码算法。第3.2节 (https://arxiv.org/html/2607.02781#S3.SS2)随后给出该估计器在有限样本下的理论保证。
### 3.1 模型与估计
我们的出发点是Safe RLHF的公式,它通过奖励模型r(x,y)和成本模型c(x,y)将有用性和安全性分开,其中x是提示,y是响应。本小节分三步。我们首先陈述约束目标,并解释为什么强对偶性允许我们处理其对偶形式。然后,我们推导出由此产生的一维对偶目标以及固定乘子λ对应的吉布斯倾斜策略。最后,我们描述如何从小校准集经验地估计λ,以及如何将生成的增强奖励相似文章
潜在奖励引导:一种在推理大语言模型中隐式促进认知行为的自适应推理时框架
介绍了潜在奖励引导(LRS),一种自适应推理时框架,利用稀疏自编码器的潜在状态和学习的奖励模型,隐式促进推理大语言模型中的验证和回溯等认知行为,从而在多个模型和基准测试中提升性能。
通过自适应安全约束实现非平稳环境下的安全持续强化学习
提出LILAC+框架,用于非平稳环境下的安全持续强化学习,该框架采用三种自适应安全机制:基于上下文的安全约束、适应速度约束和预算到状态的安全执行。在模拟驾驶环境中的评估表明,在分布偏移下,该框架减少了安全违规,同时保持了竞争性的性能。
当自回归一致性损害安全对齐时
本文分析了大型语言模型安全对齐为何脆弱,将其归因于“自回归一致性”——即下一个词元预测倾向于扩展当前响应轨迹——这导致对齐更新集中在早期词元上。作者提出了一种利用这一特性的“随机插入攻击”,并设计了一个对抗性安全对齐框架来应对。
面向鲁棒即插即用适配的解耦对齐
介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。
TRACE:基于轨迹的LLM训练后重对齐安全补丁学习
TRACE提出了一种基于轨迹的安全补丁学习框架,用于LLM训练后重对齐。该框架学习一个插件式补丁,在任务相关方向上干扰最小,同时果断控制不安全行为,在基准测试中实现接近100%的安全性,同时保持实用性。