CSULoRA: 最接近安全更新的低秩适应

arXiv cs.LG 论文

摘要

CSULoRA是一种事后方法,用于纠正训练后的LoRA适配器,以在保持实用性的同时保留安全对齐,该方法利用最接近安全更新估计。

arXiv:2605.30640v1 Announce Type: new 摘要:低秩适配已成为大型语言模型参数高效微调的标准方法,但即使是少量不安全或对抗性微调数据,也可能会显著削弱已对齐模型的安全行为。现有的安全保持LoRA方法通常依赖于硬性干预,如投影、剪枝、阈值设定或额外的训练目标。虽然这些方法可以抑制不安全的更新方向,但它们也可能移除任务相关信息或需要额外调优。我们引入了CSULoRA,一种通过最接近安全更新估计来纠正训练后LoRA适配器的事后方法。CSULoRA从安全对齐模型与其对应基础检查点之间的权重位移中估计一个安全对齐的子空间。然后它将每个LoRA更新分解为完全对齐、部分对齐和子空间外组件。CSULoRA没有丢弃估计安全子空间之外的组件,而是解决一个闭式惩罚最小变化问题,该问题保留完全对齐的组件,同时根据其相对能量平滑地衰减潜在不安全的更新方向。在对抗性微调实验中,CSULoRA大幅降低了攻击成功率,同时保留了从标准LoRA微调中获得的大部分实用性增益。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:29

# CSULoRA:最接近安全更新的低秩适配
来源:https://arxiv.org/html/2605.30640
Oleksandr Marchenko Breneur Adelaide Danilov Aria Nourbakhsh Salima Lamsiyah 卢森堡大学计算机科学系,Esch\-sur\-Alzette,卢森堡 通讯作者:oleksandr\.marchenko\.002@student\.uni\.lu (https://arxiv.org/html/2605.30640v1/mailto:[email protected])

###### 摘要

低秩适配已成为大语言模型参数高效微调的标准方法,但即使少量不安全或对抗性微调数据也可能严重削弱对齐模型的安全行为。现有的安全保持LoRA方法通常依赖硬干预,如投影、剪枝、阈值化或额外训练目标。这些方法虽能抑制不安全更新方向,但可能同时移除任务相关信息或需要额外调参。我们提出CSULoRA,一种通过最接近安全更新估计来修正已训练LoRA适配器的后处理方法。CSULoRA从安全对齐模型与其对应基座检查点之间的权重位移中估计安全对齐子空间,然后将每个LoRA更新分解为完全对齐、部分对齐和子空间外分量。不同于丢弃估计安全子空间外的分量,CSULoRA求解一个闭式惩罚最小变化问题,该问题保留完全对齐分量,同时根据相对能量平滑衰减潜在不安全方向。在对抗性微调实验中,CSULoRA显著降低攻击成功率,同时保留了标准LoRA微调所获得的大部分效用增益¹¹¹https://github.com/Oleksandr-MB/NLPAICS2026_CSULoRA。

## 1 引言

低秩适配(LoRA)广泛用于参数高效微调,它通过小的可训练低秩更新来适配大语言模型,同时保持基座模型冻结Hu et al. (2022 (https://arxiv.org/html/2605.30640#bib.bib4))。然而,最近研究表明,微调对齐模型会削弱安全行为并增加对有害提示的顺从性,即使微调数据量小或并非明确设计为对抗性Yang et al. (2023 (https://arxiv.org/html/2605.30640#bib.bib8)); Qi et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib5)); Bianchi et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib24))。这促使了后处理方法的发展,通过修改已训练的LoRA适配器来减少安全退化,而无需重新训练整个模型。

现有的安全保持LoRA和后处理安全恢复方法包括:基于投影的修正Hsu et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib1))、基于剪枝的修正Ao et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib3))、基于安全模块的适配Li et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib2))、Fisher或几何引导的正则化Das et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib17))、任务算术恢复Bhardwaj et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib15))、逐层合并Djuhera et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib27))或delta修正Lu et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib28))方法。尽管在某些场景下有效,但这些方法可能丢弃任务相关信息,或需要额外训练、剪枝决策、阈值设定、正则化目标或外部安全向量构建。

请参阅图注图1:CSULoRA概览。给定一个对齐模型及其对应的基座检查点,CSULoRA首先估计对齐位移V=Waligned−WbaseV=W_{\mathrm{aligned}}-W_{\mathrm{base}}。对于每个已训练的LoRA更新ΔW=BA\Delta W=BA,它从VV构造左右对齐感知投影器,将ΔW\Delta W分解为完全对齐、部分对齐和非对齐分量,并求解一个优化问题,保留完全对齐分量同时软性惩罚其余块中的能量。修正后的更新ΔW⋆\Delta W^{\star}被重新分解为LoRA矩阵B⋆A⋆B^{\star}A^{\star},保留原始适配器结构。我们提出CSULoRA,一种针对LoRA适配器的后处理最接近安全更新方法。CSULoRA将每个已训练的适配器更新分解为与估计安全对齐子空间重叠程度不同的分量。它不直接移除子空间外分量,而是求解一个惩罚最小变化优化问题,精确保留完全对齐分量,同时平滑衰减对齐一致性较差的更新方向。CSULoRA无需重新训练、无需额外可训练参数、无需基于验证集的阈值选择。给定一个已训练的LoRA适配器和一对基座/对齐模型,它能以闭形式确定性计算修正后的适配器。

我们的实验研究对抗性微调场景,即良性受限指令遵循数据中混入少量不安全示例。与标准LoRA和安全保持基线相比,CSULoRA显著降低攻击成功率,同时保留了LoRA微调带来的大部分效用提升,并保持通用能力。

## 2 相关工作

### 语言模型的参数高效适配。

参数高效微调已成为适配大语言模型的标准策略,无需更新所有模型参数。早期的基于适配器方法将小型可训练模块插入冻结的预训练网络中,降低了任务特定参数成本,同时保留了全微调的大部分优势Houlsby et al. (2019 (https://arxiv.org/html/2605.30640#bib.bib30))。LoRA进一步简化了这一范式,通过将低秩可训练矩阵注入现有权重层,保持骨干网络冻结,且不增加推理时的架构深度Hu et al. (2022 (https://arxiv.org/html/2605.30640#bib.bib4))。由于LoRA在适配质量与计算成本之间提供了良好的权衡,它已成为定制指令微调LLM的广泛使用机制。然而,同样的灵活性也带来了安全风险:小的低秩更新可能显著改变模型行为,包括对齐过程中学到的拒绝和安全模式。

### 微调导致的安全退化。

最近研究表明,对齐LLM的安全行为在下游微调中是脆弱的。Shadow Alignment展示了少量恶意示例即可颠覆安全对齐模型,同时很大程度上保留其通用帮助性Yang et al. (2023 (https://arxiv.org/html/2605.30640#bib.bib8))。类似地,在对抗性或甚至良性用户数据集上微调对齐语言模型会削弱安全护栏并增加有害顺从性Qi et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib5))。这些发现促使了在适配过程中或之后保护对齐的方法,特别是在用户微调开源或API可访问模型的场景中。我们的工作沿着这一研究方向,但专注于已训练LoRA适配器的后处理修正,目标是在不重新训练整个模型或不丢弃适配所获效用的情况下恢复安全。

### 安全保持的LoRA适配。

最近几种方法修改了LoRA训练或后处理以减少安全退化。SafeLoRA将选定的LoRA权重投影到从基座与对齐检查点差异估计的安全对齐子空间上Hsu et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib1))。这使得它与CSULoRA密切相关,因为两者都使用基座-对齐位移作为对齐相关方向的代理。然而,SafeLoRA应用硬投影,而CSULoRA将每个更新分解为对齐重叠块,并应用闭式软衰减规则。SPLoRA则使用距离引导准则识别并剪枝可能损害安全对齐的LoRA层Ao et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib3))。SaLoRA引入固定安全模块和任务特定初始化以在适配过程中保持安全Li et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib2))。AlignGuard-LoRA将安全保持微调形式化为一个正则化适配问题,在训练期间约束对齐漂移Das et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib17))。这些方法表明LoRA更新包含安全相关结构,但它们通常依赖硬投影、剪枝、额外安全模块、正则化损失或方法特定的超参数。相比之下,CSULoRA是一种确定性的后处理适配器手术方法:无需额外训练,并保留原始LoRA秩和适配器结构。

### 后处理安全恢复与更新空间修正。

另一条互补的工作线通过修改模型delta或合并模型权重在微调后恢复安全。RESTA使用任务算术将安全向量添加回受损模型Bhardwaj et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib15))。SafeDelta估计微调delta中的安全退化,并应用安全感知的后训练修正以在限制安全损失的同时保持效用Lu et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib28))。SafeMERGE基于逐层偏离安全行为的程度,有选择地合并来自微调模型和安全对齐模型的层Djuhera et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib27))。这些方法展示了后处理修正的有效性,但它们通常操作在模型delta或层合并级别。CSULoRA的区别在于直接操作已训练的LoRA适配器矩阵,并通过推导一个最小变化的闭式更新来衰减对齐一致性较差的组件,而非替换或合并整个层。

### 用于保持模型行为的投影与子空间方法。

CSULoRA也与约束参数空间中更新方向的几何方法相关。OPLoRA使用双侧正交投影,通过限制LoRA更新远离冻结权重的优势奇异方向来防止灾难性遗忘Xiong and Xie (2025 (https://arxiv.org/html/2605.30640#bib.bib20))。CSULoRA采用了类似的双侧投影视角,但目标和子空间定义不同:它不是保护预训练知识不被遗忘,而是从基座-对齐位移中估计对齐相关的输入和输出子空间,并软性惩罚这些子空间之外的LoRA分量。这使得CSULoRA成为基于投影的适配器修正的安全导向扩展,介于硬投影方法与更广泛的后处理安全恢复技术之间。

## 3 提出方法

我们提出CSULoRA,一种针对已训练LoRA适配器的后处理修改方法,它执行安全导向的适配器手术而无需额外训练。给定一个在安全对齐模型之上训练的LoRA适配器,CSULoRA通过求解一个最小变化优化问题来重写每个逐层更新。与可能完全丢弃更新子空间外分量的硬投影方法相反,CSULoRA保留完全位于估计安全对齐子空间内的分量,并根据相对能量软性衰减其余分量(图1 (https://arxiv.org/html/2605.30640#S1.F1))。

设第ii层的原始LoRA更新为

ΔW0i=BiAi,\Delta W^{i}_{0}=B^{i}A^{i},其中Ai∈Rr×dinA^{i}\in \mathbb{R}^{r\times d_{\mathrm{in}}}且Bi∈Rdout×rB^{i}\in \mathbb{R}^{d_{\mathrm{out}}\times r}。为了估计该层的安全对齐方向,我们使用安全对齐检查点与其对应的对齐前基座检查点之间的权重位移:

Vi=Walignedi−Wbasei.V^{i}=W^{i}_{\mathrm{aligned}}-W^{i}_{\mathrm{base}}.这里,WalignedW_{\mathrm{aligned}}表示安全对齐的指令微调检查点Rafailov et al. (2023 (https://arxiv.org/html/2605.30640#bib.bib25)); Ouyang et al. (2022 (https://arxiv.org/html/2605.30640#bib.bib23)),而WbaseW_{\mathrm{base}}表示对应的对齐前基座模型检查点。LoRA适配器本身应用于WalignedW_{\mathrm{aligned}}之上;仅使用基座检查点来估计对齐引起的位移ViV^{i}。遵循基于投影的安全保持LoRA方法Hsu et al. (2024 (https://arxiv.org/html/2605.30640#bib.bib1)); Ao et al. (2025 (https://arxiv.org/html/2605.30640#bib.bib3)),我们将ViV^{i}的优势子空间视为对齐相关方向的实际代理。

由于权重矩阵将输入空间映射到输出空间,我们在更新两侧都估计对齐相关子空间。这遵循OPLoRA的双侧投影视角,其中左右投影器用于控制LoRA更新如何与权重矩阵的奇异结构交互Xiong and Xie (2025 (https://arxiv.org/html/2605.30640#bib.bib20))。然而在CSULoRA中,投影器是从对齐deltaViV^{i}构建的。ViV^{i}的优势列空间定义了输出空间基ULiU_{L}^{i},而ViV^{i}的优势行空间定义了输入空间基URiU_{R}^{i}。这些基导出了正交投影器

PLi=ULi(ULi)⊤,PRi=URi(URi)⊤.P_{L}^{i}=U_{L}^{i}(U_{L}^{i})^{\top},\qquad P_{R}^{i}=U_{R}^{i}(U_{R}^{i})^{\top}.
为降低计算成本,我们使用带幂迭代的随机低秩范围查找器近似这些优势子空间Halko et al. (2011 (https://arxiv.org/html/2605.30640#bib.bib14)); Tropp and Webber (2023 (https://arxiv.org/html/2605.30640#bib.bib11))。有效秩自适应地选择,通过保留足够多的奇异值能量以解释对齐位移能量的95%95\%。

给定投影器PLiP_{L}^{i}和PRiP_{R}^{i},我们将原始LoRA更新ΔW0i\Delta W^{i}_{0}分解为四个投影块:

ΔWLRi=PLiΔW0iPRi,\displaystyle\Delta W^{i}_{LR}=P_{L}^{i}\Delta W^{i}_{0}P_{R}^{i},ΔWLR‾i=PLiΔW0i−ΔWLRi,\displaystyle\Delta W^{i}_{L\bar{R}}=P_{L}^{i}\Delta W^{i}_{0}-\Delta W^{i}_{LR},ΔWL‾Ri=ΔW0iPRi−ΔWLRi,\displaystyle\Delta W^{i}_{\bar{L}R}=\Delta W^{i}_{0}P_{R}^{i}-\Delta W^{i}_{LR},ΔWL‾R‾i=ΔW0i−PLiΔW0i−ΔW0iPRi+ΔWLRi.\displaystyle\Delta W^{i}_{\bar{L}\bar{R}}=\Delta W^{i}_{0}-P_{L}^{i}\Delta W^{i}_{0}-\Delta W^{i}_{0}P_{R}^{i}+\Delta W^{i}_{LR}.
块ΔWLRi\Delta W^{i}_{LR}位于对齐的输入和输出子空间中,因此被视为对齐一致性最强的分量。混合块ΔWLR‾i\Delta W^{i}_{L\bar{R}}和ΔWL‾Ri\Delta W^{i}_{\bar{L}R}仅位于一个对齐子空间中,而ΔWL‾R‾i\Delta W^{i}_{\bar{L}\bar{R}}位于两者之外。

为清晰起见,定义所有块名称的集合:

B={LR,LR‾,L‾R,L‾R‾}\mathcal{B}=\{LR,\,L\bar{R},\,\bar{L}R,\,\bar{L}\bar{R}\}
CSULoRA的核心是一个惩罚优化问题。我们寻找一个最优更新ΔW⋆i\Delta W^{i}_{\star},它保持接近原始LoRA更新,同时惩罚部分对齐和非对齐块中的能量:

ΔW⋆i\displaystyle\Delta W^{i}_{\star}

相似文章

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。

AdaPreLoRA:Adafactor 预条件低秩适应

Hugging Face Daily Papers

AdaPreLoRA 是一种新颖的 LoRA 优化器,它利用 Adafactor 对角 Kronecker 预条件来改进因子空间更新,同时保持低内存占用,在各种大语言模型(LLM)和任务中表现出具有竞争力的性能。