TRACE:基于轨迹的LLM训练后重对齐安全补丁学习

arXiv cs.LG 论文

摘要

TRACE提出了一种基于轨迹的安全补丁学习框架,用于LLM训练后重对齐。该框架学习一个插件式补丁,在任务相关方向上干扰最小,同时果断控制不安全行为,在基准测试中实现接近100%的安全性,同时保持实用性。

arXiv:2607.16242v1 公告类型:新 摘要:微调即服务(FTaaS)平台允许用户在定制任务上训练大语言模型(LLM),但这一流程可能会削弱模型的安全对齐。实践中,服务提供商需要在不重新运行完整对齐或破坏从定制任务中获得效用的前提下恢复模型的安全性。现有的一类工作涉及模型参数合并,即在微调后的模型参数上添加一个安全补丁,使模型远离不安全倾向。然而,这种基于合并的范式在根本上受到任务-安全更新纠缠的瓶颈:下游任务更新和安全补丁的主导方向常常重叠,因此合并强度本质上难以校准。如果安全向量缩放得太弱,有害成分仍可能占据主导,阻止模型回到安全区域;如果缩放得过于激进,则会抑制任务相关方向,降低实用性。为解决这一问题,我们将基于合并方法的焦点从设计在线合并操作符转向离线补丁学习,寻求一种在任务相关方向上干扰最小、同时保留对不安全行为决定性控制的安全补丁。我们提出TRACE,一个基于轨迹的安全补丁学习框架,该框架(i)模拟有害微调轨迹以生成逐渐恶化的状态,(ii)优化一个插件补丁,在不同受损基状态下恢复安全性并保持实用性。在六个基准测试和两个模型上,TRACE始终占据安全-效用前沿。TRACE在所有设置下达到接近100%的安全性,同时保持与未经防御的微调模型相当的实用性。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:47

# TRACE:基于轨迹的LLM后训练安全补丁学习  
Source: https://arxiv.org/html/2607.16242  

Changyue Li¹,², Jiaming He², Youliang Yuan¹, Jialin Wu², Boxi Yu³, Zhicong Huang²†, Pinjia He¹†  
†通讯作者。邮箱:{changyueli, youliangyuan}@link.cuhk.edu.cn; {jinlin.wjl, enchong.hjm, zhicong.hzc}@antgroup.com; [email protected]; [email protected]  

###### 摘要  
微调即服务(FTaaS)平台允许用户在定制任务上训练大语言模型(LLM),但这一流程可能侵蚀模型的安全对齐。实践中,服务提供商需要在无需重新运行完整对齐或破坏定制任务所获效用的前提下恢复模型的安全性。现有工作有一类称为*模型参数合并*的方法,通过在微调模型参数上添加安全补丁,将模型从危险倾向中偏移出来。然而,这种基于合并的范式从根本上受限于*任务-安全更新纠缠*:下游任务更新和安全补丁在主导方向上往往重叠,因此合并强度本质上难以校准。若安全向量缩放过弱,有害组件仍可能占主导,导致模型无法回归安全区域;若缩放过强,则会抑制任务相关方向,降低效用。为解决此问题,我们将基于合并方法的关注点从设计在线合并算子转向离线补丁学习,寻求一种既最小程度干扰任务相关方向,又能对不安全行为保持决定性控制的安全补丁。我们提出TRACE,一个基于轨迹的安全补丁学习框架,该框架:(i) 模拟有害微调轨迹以生成逐步恶化的状态,(ii) 优化一个插件式补丁,使其能在不同恶化的基态下恢复安全性并保持效用。在六个基准测试和两个模型上,TRACE始终主导安全-效用边界。TRACE在所有设置下达到接近100%的安全性,同时保持与未防御微调模型相当的效用。  

## 1 引言  

图1:微调即服务部署中的后训练安全恢复。用户可能上传私有良性或有害数据;提供商首先在上传数据上微调LLM,然后在微调后附加安全补丁,使得对微调模型的API查询同时保留安全性和下游效用。现有方法主要研究如何将安全补丁与微调模型合并,即参数合并操作,而本文研究如何通过基于轨迹的优化学习一个解耦且决定性的安全补丁。  

表 I:用于后训练安全恢复的干预范式比较。  

| 范式 | 方法 | 安全性 | 效用 | 鲁棒性 | 效率 | 可扩展性 | 阶段 | 机制 |
|------|------|--------|------|--------|------|----------|------|------|
| 预微调对齐强化 | Vaccine[18], Booster[17] | ○ | ○ | ● | ● | ● | // | // |
| 微调中安全保持 | SaLoRA[25], SPF[45] | ○ | ○ | ○ | ○ | ● | ∼10³ | 微调中 |
| 后微调(基于合并) | 在线合并操作:RESTA[6], EnchTable[38], SafeLoRA[15], SafeDelta[28] | ● | ○ | ○ | ● | ○ | 10¹∼10² | 后微调 |
| 离线补丁学习 | TRACE(本文) | ● | ● | ● | ● | ● | ∼0.5 | 后微调 |
注:○、半○、●分别表示弱、中等、强支持。安全性:恢复或在用户微调后维持安全的能力。效用:保持下游任务性能的能力。鲁棒性:对下游训练强度的鲁棒性和稳定性,确保在面对不同恶意或良性用户时可用并恢复安全。效率:每用户在线安全恢复所需的额外计算开销(秒)。可扩展性:整合其他重对齐策略的能力,TRACE兼容不同干预阶段的方法,并可在同一阶段内自然集成在线合并操作。  

微调即服务(FTaaS)平台如OpenAI[30]、Google Cloud[12]、Microsoft Azure[29]和Amazon Bedrock[1]允许用户上传个人数据以定制大语言模型(LLM)[41,13],服务提供商执行训练并通过API交付微调模型。这种范式降低了用户的基础设施门槛并保护了专有模型权重。然而,FTaaS也可能侵蚀LLM固有的安全对齐[42],尤其是在面对恶意用户时。因此,服务提供商需要一种后训练防御机制,在不重新运行完整对齐或破坏定制任务所获效用的前提下恢复安全性。如表I所示,当前重对齐研究可根据干预阶段分为三类。*(i) 预微调对齐强化*方法[18,17]增强基础模型,使其安全性能更抵抗后续微调。*(ii) 微调中安全保持*方法[45,25]在训练过程中约束微调动态以保持安全性。然而,尽管这两类方法提供了一定抵抗力,当模型在足量有害数据上微调时,最终可能收敛到不安全状态。近期,一类名为*(iii) 后微调基于合并*的方法[6,38,15,28]出现,通过将微调模型与安全补丁合并来恢复安全对齐。如图1所示,用户可能上传良性或有害数据。服务提供商首先在上传数据上微调LLM,然后在微调后附加安全补丁以恢复安全行为,同时保持良性效用。当用户查询提供的API访问微调模型时,该模型同时保留安全性和任务效用。  

虽然基于合并的方法轻量且高效,但现有工作存在固有的*任务-安全更新纠缠*瓶颈:安全补丁和用户任务更新作用在同一参数空间,且方向往往重叠。这种方向性纠缠导致相互干扰[19],使得在安全性和效用之间达到最优折衷变得困难。例如,弱修复无法消除不安全行为,而激进修复则会降低任务效用。这一困境因用户训练强度的不确定性而进一步加剧。在实际FTaaS平台[30]中,用户通常可指定上传数据集的大小、训练轮数和学习率,这导致下游任务微调强度存在巨大差异。从提供商角度看,这种定制训练的变异性使得通过固定修复强度为每个用户实现最优安全-效用平衡变得困难。  

这种折衷困境促使我们将基于合并方法的关注点从在线合并操作转向离线补丁优化。我们不追问如何针对不可预测的用户更新校准修复强度,而是聚焦于一个更基本的问题:我们能否学习一个决定性的安全补丁,使其本质性地与用户更新方向解耦?在理想状态下,如果我们能识别出这样一个解耦的安全补丁,任务-安全瓶颈将得到缓解,因为安全恢复与用户定制任务之间的干扰被最小化。这意味着安全补丁不会破坏良性任务性能,而用户更新也不会削弱补丁的有效性。面对不同的微调强度,服务提供商只需简单地应用该安全补丁,无需针对每个用户进行校准,从而有效恢复安全性,同时保持下游效用不变。  

为此,我们提出TRACE,一个基于轨迹的框架,用于离线学习一个解耦且决定性的安全补丁。TRACE通过“模拟-恢复”策略实现这一目标。首先,它模拟一个微调轨迹以生成逐步恶化的模型状态,有效捕捉不同训练强度的变化。随后,TRACE优化一个通用插件式适配器,旨在跨这些恶化状态一致地恢复安全性,同时严格保持任务效用。该目标明确鼓励学习到的补丁最小化对下游任务性能的干扰,同时在与有害更新共存时仍保持决定性效果。因此,学习到的TRACE补丁可以通过标准合并无缝集成到任何微调模型中,为服务提供商提供一种高效的后训练重对齐机制。  

大量实验验证了我们提出框架的优越性。我们在两个代表性模型上,使用三个分布外有害数据集[42,33,21](不同大小)以及三个效用基准(涵盖对话摘要[10]、SQL生成[3]和数学求解[7])对TRACE进行了评估。结果突出表明,TRACE有效解决了安全-效用困境。值得注意的是,TRACE在所有基准和模型组合上至少达到94%的安全率。在最具挑战性的基准上,TRACE将安全率从23%提升至100%,是第二优值的四倍多,同时保持下游任务性能与未防御基线偏差极小(±1.7%以内)。这些结果验证了TRACE实现鲁棒安全恢复的能力。我们的主要贡献总结如下:  

- • 我们识别出当前基于合并的安全恢复方法中的一个结构性瓶颈,我们称之为*任务-安全更新纠缠*。我们揭示了安全补丁与用户任务更新之间的方向重叠导致相互干扰,从而降低了安全恢复和良性任务效用。  
- • 我们将基于合并范式的关注点从耗时的在线校准转向离线优化,并提出了TRACE,一个基于轨迹的安全补丁学习框架。TRACE模拟一个微调轨迹以生成逐步恶化的模型状态,捕获不同的训练强度。然后它优化一个通用安全补丁,以在这些状态上一致地恢复安全性,同时保持任务效用。  
- • 我们在两个代表性LLM上进行了大量实验,涵盖三个分布外安全基准和三个多样化效用基准。结果表明,TRACE有效解决了安全-效用困境,在所有实验设置下实现接近100%的安全率,同时保持良性任务性能与未防御基线偏差极小。  

## 2 威胁模型与问题定义  

### 2.1 威胁模型  
本文考虑典型的FTaaS场景,涉及两个主要实体:服务提供商和用户。服务提供商托管一个已充分对齐的基础模型,记为θ_{\text{base}},该模型经过广泛的安全对齐。为将该模型适配到特定下游应用,提供商允许用户上传个人数据集,然后分配计算资源在该数据集上训练θ_{\text{base}},得到微调模型θ_{\text{ft}}。然而,此过程可能损害模型的安全对齐。为恢复其安全性,提供商提前准备一个安全补丁,并将其合并到模型中。最后,提供商通过API向用户授予对该无害、任务特定的部署模型θ_{\text{deploy}}的推理权限。该服务使用户能够轻松访问定制能力,同时提供商保护专有模型权重。  

我们关注FTaaS生态中下游微调阶段的漏洞,其中用户对上传的数据集拥有完全控制权,并可指定训练超参数如轮数、学习率和批次大小。服务提供商无法预知用户数据分布或具体训练强度,导致微调模型θ_{\text{ft}}表现出高度可变且不可预测的安全性退化程度。  

目标和约束。服务提供商的主要目标是提供推理API,严格保证模型安全性和下游任务效用。无论用户上传何种数据,即使数据集包含明确有害内容,此双重需求都应得到满足。同时,为了支撑商业FTaaS平台上大量用户,提供商面临关键效率约束。所采用的安全恢复机制必须高度高效,并在定制和部署过程中引入最小计算开销。  

### 2.2 问题定义  
设θ_{\text{base}}表示提供商托管的对齐基础模型。在线服务阶段,用户上传私有数据集以获得查询部署模型θ_{\text{deploy}}的API。在本小节中,我们主要讨论两类用户:恶意用户提交有害数据U_{\text{harm}}={(x_h, y_h)},其中x_h, y_h表示有害查询和响应;良性用户上传高度定制的任务数据U_{\text{task}}={(x_t, y_t)}。提供商的目标是鲁棒地强制执行模型安全性以防止恶意利用,同时不损害良性定制的任务性能。  

基于合并的方法离线构造一个安全补丁Δθ_{\text{patch}}并在线合并。通常,Δθ_{\text{patch}}通过首先在代理有害数据上离线训练一个故意不安全的模型θ_{\text{unsafe}},然后取对齐基础模型与该有害模型之间的参数差,即Δθ_{\text{patch}} = θ_{\text{base}} - θ_{\text{unsafe}}[6,38]。这个预计算的离线补丁随后在线合并:θ_{\text{deploy}} = θ_{\text{base}} ⊕ Δθ_{\text{user}} ⊕ Δθ_{\text{patch}}

相似文章

面向鲁棒即插即用适配的解耦对齐

arXiv cs.CL

介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性

arXiv cs.AI

本文提出了一个混合框架,结合一阶安全对齐与零阶微调,以增强LLM安全对齐在受到对齐后扰动时的鲁棒性。理论和实验结果表明,仅需少量微调步骤即可在保持安全性的同时提升鲁棒性。

当自回归一致性损害安全对齐时

arXiv cs.LG

本文分析了大型语言模型安全对齐为何脆弱,将其归因于“自回归一致性”——即下一个词元预测倾向于扩展当前响应轨迹——这导致对齐更新集中在早期词元上。作者提出了一种利用这一特性的“随机插入攻击”,并设计了一个对抗性安全对齐框架来应对。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。