Compliance2LoRA:通过超网络生成的LoRA适配器在任意策略子集上实现按需安全对齐

arXiv cs.LG 论文

摘要

Compliance2LoRA提出了一种基于超网络的框架,可为大型推理模型按需生成符合策略的LoRA适配器,从而在无需重新训练单独模型的情况下,实现跨任意策略子集的可调安全对齐。

arXiv:2607.27594v1 公告类型:新 摘要:大型推理模型(LRMs)的后训练对齐显著提高了它们对多样化安全合规设置的适应性。然而,随着针对下游用户的LRM个性化成为焦点,对不同策略合规水平的需求也在增长,因为不同的用户特定LRM必须遵守不同的安全策略子集。为每个策略子集训练单独的LRM会引入严重的组合开销。虽然上下文学习方法克服了这种组合开销,但它们引入了与长上下文生成相关的额外计算挑战。为了解决这一挑战,我们提出了\ours,一种基于统一自适应超网络的多策略合规框架。在我们的框架中,安全策略作为可定制的输入提供给LoRA适配器生成器,该生成器学习为下游LRM生成符合策略的LoRA权重。当这些权重添加到LRM时,能够生成符合指定策略子集的响应。在这项工作中,我们证明了训练这样的超网络可以在单个LRM上实现按需策略调整,而不会牺牲不同规模和不同评估数据集上的推理模型的任务性能。这凸显了基于自适应超网络的对齐在LRM中的有效性和实用性。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:04

# Compliance2LoRA:通过超网络生成的LoRA适配器实现任意策略子集的按需安全对齐
来源:https://arxiv.org/html/2607.27594
Furong Huang,马里兰大学学院帕克分校

###### 摘要

大型推理模型(LRMs)中的训练后对齐显著提升了它们对不同安全合规设置的适应性。然而,随着面向下游用户的LRM个性化成为焦点,对不同策略合规程度的需求日益增长,因为不同的用户特定LRM必须遵守不同的安全策略子集。为每个策略子集单独训练一个LRM会带来严重的组合开销。虽然上下文学习方法克服了这种组合开销,但引入了与长上下文生成相关的额外计算挑战。为了应对这一挑战,我们提出了Compliance2LoRA,一个基于自适应超网络的统一多策略合规框架。在我们的框架中,安全策略作为可定制输入提供给LoRA适配器生成器,该生成器学习为下游LRM生成符合策略的LoRA权重。当这些权重添加到LRM后,能够生成符合指定策略子集的响应。在这项工作中,我们证明训练这样的超网络能够在单个LRM上实现按需策略调整,而不会牺牲不同规模推理模型和不同评估数据集上的任务性能。这凸显了基于自适应超网络的对齐方法在LRMs中的有效性和实用性。

## 1 引言

大型推理模型(LRMs)(Guo et al.,2025) 在推理、安全性和能力方面展现了大规模进步,这在很大程度上得益于更强的训练后对齐(Bai et al.,2022, Ouyang et al.,2022, Rafailov et al.,2024, Guan et al.,2025)。就模型安全而言,当这些模型部署给下游用户时,他们对安全合规的要求开始出现差异,因此在部署时需要多个模型版本。解决此问题的一种经典方法是训练符合不同策略子集的多个LRM版本,并为每个特定用户提供这些模型。这最大限度地减少了每次生成时向提示中添加上下文策略所带来的token成本。然而,随着合规策略数量的增加——在商业服务场景中,用户可能因地理位置、用户偏好、年龄等而受制于不同的策略集——维护不同版本的LRM变得不切实际,原因有二。首先,存储组合数量的模型对于部署而言不切实际。其次,稀有的策略子组往往缺乏数据样本,从而阻碍了某些版本LRM的训练。为此,在这项工作中,我们探索了在动态超网络框架下统一这一对齐问题的可能性,我们称之为Compliance2LoRA。超网络(Ha et al.,2016)是被训练为直接生成模型权重的网络,从而能够创建自适应模型。具体而言,如图1所示,我们提出训练一个以多个策略为条件的超网络,这些策略被转换为单独的嵌入,并通过自注意力机制

相似文章

Code2LoRA:超网络生成的适配器,用于软件演进中的代码语言模型

Hugging Face Daily Papers

Code2LoRA 引入了一个超网络,该超网络能够从代码仓库中一次性前向传播生成 LoRA 适配器,使得冻结的代码大语言模型无需额外 token 即可适应仓库上下文,并高效支持不断演进的代码库。此外,它还提供了 RepoPeftBench,一个用于仓库条件代码建模的基准测试。

CSULoRA: 最接近安全更新的低秩适应

arXiv cs.LG

CSULoRA是一种事后方法,用于纠正训练后的LoRA适配器,以在保持实用性的同时保留安全对齐,该方法利用最接近安全更新估计。