对齐但脆弱:通过零阶优化增强LLM安全鲁棒性
摘要
本文提出了一个混合框架,结合一阶安全对齐与零阶微调,以增强LLM安全对齐在受到对齐后扰动时的鲁棒性。理论和实验结果表明,仅需少量微调步骤即可在保持安全性的同时提升鲁棒性。
arXiv:2605.29396v1 Announce Type: new
摘要:大型语言模型(LLM)的安全对齐旨在减少有害或不安全行为,同时保持通用效用。然而,最近的研究发现,对齐效果可能很脆弱:轻量级的对齐后操作(如参数噪声、激活噪声或量化)很容易削弱预期的安全行为。先前提高鲁棒性的努力主要集中在数据整理、修改对齐目标和识别安全关键参数上,而优化器本身的作用在很大程度上未被探索。
在本文中,我们首次从基础优化器的角度研究安全对齐的鲁棒性。这种以优化器为中心的视角自然地指向零阶优化,它通过评估扰动下的安全对齐来提供面向鲁棒性的信号。基于这一见解,我们提出了一种混合框架,首先执行标准的一阶安全对齐,然后应用零阶微调来提高鲁棒性。从理论和经验上,我们表明仅需少量零阶微调步骤即可在保持安全对齐的同时增强鲁棒性。我们进一步通过利用其固有的基于扰动的评估来估计逐层鲁棒性敏感性,从而提高零阶微调的效率,使微调过程能够以适度的训练开销专注于更新鲁棒性关键层。
查看缓存全文
缓存时间: 2026/05/29 09:18
# 对齐但脆弱:通过零阶优化增强大语言模型的安全性鲁棒性 来源:https://arxiv.org/html/2605.29396 刘志浩¹,²,\*,吴一帆¹,²,\*,楼健³,王迪⁴,周宇曦²,胡宇科⁴,📧¹浙江大学区块链与数据安全全国重点实验室²杭州高新区(滨江)区块链与数据安全研究院³中山大学⁴阿卜杜拉国王科技大学 [email protected]; [email protected]; [email protected] {di.wang, yuke.hu}@kaust.edu.sa; [email protected] ###### 摘要 大型语言模型的安全对齐旨在减少有害或不安全行为,同时保持通用实用性。然而,最近的研究发现,对齐效果可能很脆弱:轻量级的对齐后操作,如参数噪声、激活噪声或量化,很容易削弱预期的安全行为。先前为提高鲁棒性所做的努力主要集中在数据整理、修改对齐目标和识别安全关键参数上,而优化器本身的作用在很大程度上尚未被探索。 在本文中,我们首次从基础优化器的角度研究安全对齐的鲁棒性。这种以优化器为中心的视角自然地指向零阶优化,它通过评估扰动下的安全对齐来提供鲁棒性导向的信号。基于这一见解,我们提出了一种混合框架,该框架首先执行标准的一阶安全对齐,然后应用零阶细化来提高鲁棒性。在理论和实践上,我们都表明只需少量的零阶细化步骤就能在保持安全对齐的同时增强鲁棒性。我们进一步利用零阶优化固有的基于扰动的评估来估计逐层鲁棒性敏感性,从而使细化过程能够以适度的训练开销集中更新鲁棒性关键层,从而提高效率。 ††脚注:\*同等贡献。📧通讯作者。 ## 1 引言 大型语言模型[42 (https://arxiv.org/html/2605.29396#bib.bib12), 32 (https://arxiv.org/html/2605.29396#bib.bib11)]在从问答到复杂指令遵循的广泛任务中展示了卓越的能力。随着它们在现实场景中的部署日益增多,对其可靠性、安全性和鲁棒性的担忧已成为一个主要问题[46 (https://arxiv.org/html/2605.29396#bib.bib15)]。为了解决这些风险,开发人员在预训练后引入了一个额外的安全对齐阶段,通常通过监督微调或偏好优化来实现。这些方法主要在对齐数据、训练目标和模型级安全表示方面有所不同,但通常通过基于梯度的更新进行优化[29 (https://arxiv.org/html/2605.29396#bib.bib5), 33 (https://arxiv.org/html/2605.29396#bib.bib6), 6 (https://arxiv.org/html/2605.29396#bib.bib13), 11 (https://arxiv.org/html/2605.29396#bib.bib14)]。这个阶段对权重进行相对较小但有目标的调整,以阻止生成有害、不道德或危险的内容,同时保留模型的通用实用性和指令遵循能力[9 (https://arxiv.org/html/2605.29396#bib.bib16), 21 (https://arxiv.org/html/2605.29396#bib.bib17)]。 尽管在开发有效且高效的大语言模型安全对齐算法方面取得了最新进展,但实现*鲁棒*的安全对齐仍然是一个重大挑战。特别是,在对模型权重或中间激活进行对齐后扰动时,安全性能可能会迅速恶化。最近的研究表明,即使是微小且通用的干扰也能显著削弱安全对齐:向模型权重注入高斯噪声会导致原本对齐的模型表现出不安全或不对齐的行为[41 (https://arxiv.org/html/2605.29396#bib.bib18)],而对特定中间激活层的扰动可以可靠地削弱安全护栏[3 (https://arxiv.org/html/2605.29396#bib.bib19), 35 (https://arxiv.org/html/2605.29396#bib.bib2)]。除了显式的噪声注入,训练后压缩技术(如量化)可能会引入近似误差,从而削弱安全对齐[48 (https://arxiv.org/html/2605.29396#bib.bib36)]。这些由扰动引起的失败表明,安全对齐可能由参数或激活空间中的一个尖锐或过拟合的安全边界编码,在该空间中,小的偏差可以将模型从拒绝转换为不安全的遵从。因此,鲁棒对齐不仅需要更强的安全信号,还需要更平滑的局部安全景观。 现有的鲁棒安全对齐研究主要关注三个方向:提高数据级鲁棒性、重新设计目标级对齐信号以及加强模型级安全表示。*数据级*方法通过整理或重新加权微调数据来提高鲁棒性[20 (https://arxiv.org/html/2605.29396#bib.bib20), 36 (https://arxiv.org/html/2605.29396#bib.bib21)];*目标级*方法修改对齐损失以鼓励更持久的拒绝行为[30 (https://arxiv.org/html/2605.29396#bib.bib22), 52 (https://arxiv.org/html/2605.29396#bib.bib23)];*模型级*方法稳定安全表示或保护安全关键层[12 (https://arxiv.org/html/2605.29396#bib.bib24), 34 (https://arxiv.org/html/2605.29396#bib.bib25), 18 (https://arxiv.org/html/2605.29396#bib.bib26)]。虽然这些方法有效,但它们通常依赖于对训练数据、对齐目标或模型内部的特定于问题的修改。相比之下,*基础优化器*本身的作用,独立于此类问题级和算法级的修改,在塑造对齐鲁棒性方面在很大程度上尚未被探索。上面讨论的由扰动引起的失败表明,鲁棒对齐也与学习到的安全边界的局部几何形状密切相关,而后者可以由基础优化器本身塑造。 这促使我们重新审视零阶优化,将其作为一种用于鲁棒安全对齐的优化器级机制。与标准的基于梯度的更新不同,零阶优化通过在随机扰动的参数上评估损失来估计更新方向,这可以看作是优化一个局部平滑的目标[28 (https://arxiv.org/html/2605.29396#bib.bib9)]。虽然最近的工作主要探索了用于内存高效的大语言模型微调[24 (https://arxiv.org/html/2605.29396#bib.bib39), 51 (https://arxiv.org/html/2605.29396#bib.bib55), 22 (https://arxiv.org/html/2605.29396#bib.bib4)]和大语言模型遗忘的零阶方法[49 (https://arxiv.org/html/2605.29396#bib.bib54), 16 (https://arxiv.org/html/2605.29396#bib.bib56)],但其在提高对齐鲁棒性方面的潜力仍未得到充分探索。 在本文中,我们致力于通过零阶方法的视角来提高安全对齐的鲁棒性,而零阶方法在这种情况下在很大程度上尚未被探索。零阶优化为对齐鲁棒性提供了一条有前景的途径,因为它评估了安全对齐在扰动下的行为。我们的研究包括三个主要组成部分。❶ 我们凭经验表明,安全对齐的模型在简单扰动下仍然脆弱:轻量级的参数或激活级噪声可以显著削弱安全行为。❷ 虽然零阶优化可以增强对齐鲁棒性,但由于其收敛速度较慢且不稳定,直接用零阶优化替换一阶优化是无效的。因此,我们提出了一种混合细化策略,在标准的一阶安全对齐之后应用零阶更新。我们在理论上和实证上都表明,少量对齐后的零阶细化可以提高安全鲁棒性,且计算开销适中。❸ 最后,我们利用零阶优化固有的基于扰动的评估来估计逐层鲁棒性敏感性,从而实现一种有针对性的细化策略,将更新集中在鲁棒性关键层上,从而提高鲁棒性导向安全对齐的效率和有效性。我们的贡献可以总结如下: - •我们首次从零阶优化的角度全面研究了安全对齐对参数和激活扰动的鲁棒性。 - •我们提出了一种FO-ZO混合优化框架,该框架整合了一阶和零阶优化器,结合了零阶诱导的鲁棒性和一阶驱动的对齐有效性。 - •我们在理论和实证上都表明,少量对齐后的零阶细化可以提高安全鲁棒性,且计算开销适中。 ## 2 背景与相关工作 ### 2.1 大型语言模型中的安全对齐 安全对齐旨在确保大型语言模型生成的输出符合人类价值观和安全约束[52 (https://arxiv.org/html/2605.29396#bib.bib23), 44 (https://arxiv.org/html/2605.29396#bib.bib52), 14 (https://arxiv.org/html/2605.29396#bib.bib53)]。一种标准范式是使用人类反馈对预训练模型进行后训练,例如来自人类反馈的强化学习[29 (https://arxiv.org/html/2605.29396#bib.bib5)]。后续工作从不同角度进一步改进或简化了这一范式。宪法人工智能通过使用一组人类编写的原则和人工智能反馈来提高无害性,从而减少了对直接人类反馈的依赖[2 (https://arxiv.org/html/2605.29396#bib.bib49)];安全RLHF明确分离了有益性和无害性偏好,并将安全对齐表述为一个约束优化问题[4 (https://arxiv.org/html/2605.29396#bib.bib50)];直接偏好优化直接从偏好数据中优化语言模型,而无需显式训练奖励模型或运行强化学习[33 (https://arxiv.org/html/2605.29396#bib.bib6)];最近的基于推理的对齐方法通过训练模型在生成最终答案之前显式推理安全要求来提高安全性[27 (https://arxiv.org/html/2605.29396#bib.bib51)]。 ### 2.2 安全对齐的鲁棒性 先前的工作已经确定了多种破坏对齐模型安全行为的方式。在输入层面,越狱和对抗性提示攻击可以通过重写、混淆或优化有害指令来绕过安全护栏[45 (https://arxiv.org/html/2605.29396#bib.bib29), 54 (https://arxiv.org/html/2605.29396#bib.bib30), 37 (https://arxiv.org/html/2605.29396#bib.bib31)]。在模型层面,安全行为可能被恶意甚至良性的微调[31 (https://arxiv.org/html/2605.29396#bib.bib32), 47 (https://arxiv.org/html/2605.29396#bib.bib33)]、持久后门[13 (https://arxiv.org/html/2605.29396#bib.bib34)]或对拒绝相关表示的干预[1 (https://arxiv.org/html/2605.29396#bib.bib35)]所削弱。这些结果表明,安全对齐可能依赖于在正常条件下有效但在对抗性输入、分布偏移或训练后修改下仍然脆弱的机制。 虽然这些失败中的许多涉及更强的攻击能力或精心设计的程序,但安全对齐也可能因更简单的变化而变得脆弱。即使是来自量化、参数噪声、激活噪声、硬件故障或其他对齐后修改的通用扰动,也可能足以降低模型的安全行为。量化降低了数值精度以提高效率[5 (https://arxiv.org/html/2605.29396#bib.bib8)],但引入的近似误差可能会改变模型行为;最近的工作进一步表明,与量化相关的故障注入可以削弱安全对齐[48 (https://arxiv.org/html/2605.29396#bib.bib36)]。类似地,权重或激活扰动可能干扰内部表示并暴露在标准推理下不可见的安全失败[40 (https://arxiv.org/html/2605.29396#bib.bib37), 3 (https://arxiv.org/html/2605.29396#bib.bib19), 35 (https://arxiv.org/html/2605.29396#bib.bib2)]。 ### 2.3 零阶优化 零阶优化通过在参数空间中的扰动点评估目标来构建梯度估计,从而降低内存消耗,而无需反向传播[28 (https://arxiv.org/html/2605.29396#bib.bib9)]。除了其计算优势之外,它还通过评估模型在扰动下的行为,为提高鲁棒性提供了一条有前景的途径。这种直觉进一步得到了基于曲率的联系的支持:零阶优化已被证明倾向于更平坦的最小值[50 (https://arxiv.org/html/2605.29396#bib.bib57)],这有助于提高对微小扰动的局部鲁棒性[43 (https://arxiv.org/html/2605.29396#bib.bib58)]。这种观点激发了先前的工作,即使用零阶优化在受限或噪声条件下训练和适应大型模型[19 (https://arxiv.org/html/2605.29396#bib.bib10), 22 (https://arxiv.org/html/2605.29396#bib.bib4)]。最近,零阶方法也已在对齐相关环境中进行了探索。Galatolo等人[7 (https://arxiv.org/html/2605.29396#bib.bib38)]探索了用于大语言模型偏好优化的零阶方法,旨在减少内存使用和迭代时间。在这项工作中,我们转而从安全对齐鲁棒性的角度研究零阶优化,并表明它可以增强大语言模型安全对齐对参数和激活篡改的抵抗力。 ## 3 预备知识 零阶梯度估计通过在扰动参数点处的函数评估来近似梯度,而无需显式梯度信息。 ###### 定义 3.1(零阶梯度估计[38 (https://arxiv.org/html/2605.29396#bib.bib3)])。 给定模型参数θ∈Rd\\boldsymbol{\\theta}\\in\\mathcal{R}^{d}和损失函数ff,在批次ξ\\xi上的零阶梯度估计为 ∇fβ\(θ,ξ\)=12β\(f\(θ\+βv,ξ\)−f\(θ−βv,ξ\)\)v,\\nabla f_{\\beta}\(\\boldsymbol{\\theta},\\xi\)=\\frac{1}{2\\beta}\\left\(f\(\\boldsymbol{\\theta}+\\beta\\mathbf{v},\\xi\)-f\(\\boldsymbol{\\theta}-\\beta\\mathbf{v},\\xi\)\\right\)\\mathbf{v},\(1\)其中v∼N\(0,Id\)\\mathbf{v}\\sim N\(0,\\textbf{I}_{d}\)且β\\beta是零阶尺度参数。 Lipschitz连续性和光滑性控制目标及其梯度的变化,是一阶和零阶收敛分析中的标准假设[24 (https://arxiv.org/html/2605.29396#bib.bib39), 23 (https://arxiv.org/html/2605.29396#bib.bib40)]。我们也采用Polyak–Łojasiewicz条件,这是非凸设置中用于推导线性收敛类型保证的常见梯度占优假设[15 (https://arxiv.org/html/2605.29396#bib.bib41)]。 ###### 定义 3.2(Lipschitz连续性)。 如果存在常数L\>0L\>0,使得对于所有θ,θ′∈Rd\\theta,\\theta^{\\prime}\\in\\mathbb{R}^{d},有 \|f\(θ\)−f\(θ′\)\|≤L‖θ−θ′‖,\\|f\(\\theta\)-f\(\\theta^{\\prime}\)\|\\leq L\\\|\\theta-\\theta^{\\prime}\\\|,则函数f\(θ\)f\(\\theta\)是LL-Lipschitz连续的。 ###### 定义 3.3(光滑性)。 设f\(θ\)f\(\\theta\)可微。如果其梯度对于所有θ,θ′∈Rd\\theta,\\theta^{\\prime}\\in\\mathbb{R}^{d}是hh-Lipschitz连续的,即 ‖∇f\(θ\)−∇f\(θ′\)‖≤h‖θ−θ′‖,\\\|\\nabla f\(\\theta\)-\\nabla f\(\\theta^{\\prime}\)\|\\leq h\\\|\\theta-\\theta^{\\prime}\\\|,则函数f\(θ\)f\(\\theta\)是hh-光滑的。 ###### 定义 3.4(Polyak–Łojasiewicz条件)。 函数fβ\(θ\)f_{\\beta}\(\\theta\)满足μ\\mu-P
相似文章
面向鲁棒即插即用适配的解耦对齐
介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。
当自回归一致性损害安全对齐时
本文分析了大型语言模型安全对齐为何脆弱,将其归因于“自回归一致性”——即下一个词元预测倾向于扩展当前响应轨迹——这导致对齐更新集中在早期词元上。作者提出了一种利用这一特性的“随机插入攻击”,并设计了一个对抗性安全对齐框架来应对。
使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税
本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。
通过溯源分析防范LLM代理失对齐
本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。