Compliance2LoRA:通过超网络生成的LoRA适配器在任意策略子集上实现按需安全对齐
摘要
Compliance2LoRA提出了一种基于超网络的框架,可为大型推理模型按需生成符合策略的LoRA适配器,从而在无需重新训练单独模型的情况下,实现跨任意策略子集的可调安全对齐。
arXiv:2607.27594v1 公告类型:新
摘要:大型推理模型(LRMs)的后训练对齐显著提高了它们对多样化安全合规设置的适应性。然而,随着针对下游用户的LRM个性化成为焦点,对不同策略合规水平的需求也在增长,因为不同的用户特定LRM必须遵守不同的安全策略子集。为每个策略子集训练单独的LRM会引入严重的组合开销。虽然上下文学习方法克服了这种组合开销,但它们引入了与长上下文生成相关的额外计算挑战。为了解决这一挑战,我们提出了\ours,一种基于统一自适应超网络的多策略合规框架。在我们的框架中,安全策略作为可定制的输入提供给LoRA适配器生成器,该生成器学习为下游LRM生成符合策略的LoRA权重。当这些权重添加到LRM时,能够生成符合指定策略子集的响应。在这项工作中,我们证明了训练这样的超网络可以在单个LRM上实现按需策略调整,而不会牺牲不同规模和不同评估数据集上的推理模型的任务性能。这凸显了基于自适应超网络的对齐在LRM中的有效性和实用性。
查看缓存全文
缓存时间: 2026/07/31 10:04
# Compliance2LoRA:通过超网络生成的LoRA适配器实现任意策略子集的按需安全对齐 来源:https://arxiv.org/html/2607.27594 Furong Huang,马里兰大学学院帕克分校 ###### 摘要 大型推理模型(LRMs)中的训练后对齐显著提升了它们对不同安全合规设置的适应性。然而,随着面向下游用户的LRM个性化成为焦点,对不同策略合规程度的需求日益增长,因为不同的用户特定LRM必须遵守不同的安全策略子集。为每个策略子集单独训练一个LRM会带来严重的组合开销。虽然上下文学习方法克服了这种组合开销,但引入了与长上下文生成相关的额外计算挑战。为了应对这一挑战,我们提出了Compliance2LoRA,一个基于自适应超网络的统一多策略合规框架。在我们的框架中,安全策略作为可定制输入提供给LoRA适配器生成器,该生成器学习为下游LRM生成符合策略的LoRA权重。当这些权重添加到LRM后,能够生成符合指定策略子集的响应。在这项工作中,我们证明训练这样的超网络能够在单个LRM上实现按需策略调整,而不会牺牲不同规模推理模型和不同评估数据集上的任务性能。这凸显了基于自适应超网络的对齐方法在LRMs中的有效性和实用性。 ## 1 引言 大型推理模型(LRMs)(Guo et al.,2025) 在推理、安全性和能力方面展现了大规模进步,这在很大程度上得益于更强的训练后对齐(Bai et al.,2022, Ouyang et al.,2022, Rafailov et al.,2024, Guan et al.,2025)。就模型安全而言,当这些模型部署给下游用户时,他们对安全合规的要求开始出现差异,因此在部署时需要多个模型版本。解决此问题的一种经典方法是训练符合不同策略子集的多个LRM版本,并为每个特定用户提供这些模型。这最大限度地减少了每次生成时向提示中添加上下文策略所带来的token成本。然而,随着合规策略数量的增加——在商业服务场景中,用户可能因地理位置、用户偏好、年龄等而受制于不同的策略集——维护不同版本的LRM变得不切实际,原因有二。首先,存储组合数量的模型对于部署而言不切实际。其次,稀有的策略子组往往缺乏数据样本,从而阻碍了某些版本LRM的训练。为此,在这项工作中,我们探索了在动态超网络框架下统一这一对齐问题的可能性,我们称之为Compliance2LoRA。超网络(Ha et al.,2016)是被训练为直接生成模型权重的网络,从而能够创建自适应模型。具体而言,如图1所示,我们提出训练一个以多个策略为条件的超网络,这些策略被转换为单独的嵌入,并通过自注意力机制
相似文章
Code2LoRA:超网络生成的适配器,用于软件演进中的代码语言模型
Code2LoRA 引入了一个超网络,该超网络能够从代码仓库中一次性前向传播生成 LoRA 适配器,使得冻结的代码大语言模型无需额外 token 即可适应仓库上下文,并高效支持不断演进的代码库。此外,它还提供了 RepoPeftBench,一个用于仓库条件代码建模的基准测试。
@_akhaliq: Code2LoRA 软件演化下代码语言模型的超网络生成适配器
本文介绍了Code2LoRA,一种基于超网络的方法,用于生成代码语言模型的适配器,以应对软件演化中的挑战。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
如果模型只能学习受信任的LoRA适配器所能表达的内容会怎样?[R]
本研究探讨了将模型的学习限制在仅能学习受信任的LoRA适配器所能表达的内容这一概念,旨在提高微调的安全性和可靠性。
CSULoRA: 最接近安全更新的低秩适应
CSULoRA是一种事后方法,用于纠正训练后的LoRA适配器,以在保持实用性的同时保留安全对齐,该方法利用最接近安全更新估计。