Palette:一种模块化、可控且高效的大语言模型按需授权安全对齐放松框架

arXiv cs.AI 论文

摘要

Palette提出了一种模块化框架,用于在授权的专业领域中选择性地放松大语言模型的安全拒绝行为,利用多目标搜索和轻量级适配来避免昂贵的重新训练。

arXiv:2605.24154v1 Announce Type: new 摘要:当前基础模型的安全对齐主要遵循一种\emph{千篇一律}的范式,对所有用户和上下文应用相同的拒绝策略。因此,模型可能会拒绝那些对普通用户不安全但对授权专业人员合法的请求,限制了在专业化场景中的实用性。现有方法要么需要昂贵的重对齐,要么依赖推理时引导,但后者存在控制不精确和额外延迟的问题。为此,我们提出\textsc{Palette},一个模块化、可控且高效的框架,能够在授权的目标领域中选择性地放松拒绝行为,同时在其他领域保持标准安全性。我们的方法通过多目标搜索识别拒绝方向,并通过轻量级适配将其内化到模型中。\textsc{Palette}进一步支持模块化组合:它独立学习领域特定的安全控制,并通过参数合并组合它们,从而实现无需重训练即可按需进行多领域授权。在四个安全基准、多个模型变体以及大语言模型和视觉大语言模型上的实验表明,\textsc{Palette}在不牺牲通用实用性的前提下提供了精确的安全控制,为适应多样化专业需求的基础模型提供了一条务实路径。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:05

# 调色板:面向大型语言模型按需授权安全放松的模块化、可控且高效框架

来源:https://arxiv.org/html/2605.24154

Qitao Tan¹, Xiaoying Song², Arman Akbari³, Arash Akbari³, Yanzhi Wang³, Xiaoming Zhai¹, Lingzi Hong², Zhen Xiang¹, Jin Lu¹, Geng Yuan¹

¹佐治亚大学,²北德克萨斯大学,³东北大学

\{qitaotan,geng\.yuan\}@uga\.edu

###### 摘要

当前基础模型的安全对齐主要遵循“一刀切”范式,对所有用户和情境应用相同的拒绝策略。因此,模型可能会拒绝那些对普通用户不安全但对授权专业人员合法合理的请求,从而限制了在专业场景中的有用性。现有方法要么需要昂贵的重新对齐,要么依赖推理时的引导,而这又存在控制不精确和延迟增加的问题。为此,我们提出了**调色板**,一个模块化、可控且高效的框架,能够在保持其他场景标准安全性的同时,有选择地放松授权目标域内的拒绝行为。我们的方法通过多目标搜索识别拒绝方向,并通过轻量级适配将其内化到模型参数中。**调色板**进一步支持模块化组合:它独立学习特定领域的安全控制,并通过参数合并进行组合,无需重新训练即可实现按需的多域授权。在四个安全基准、多个模型变体以及大语言模型和视觉语言模型上的实验表明,**调色板**在不牺牲通用实用性的前提下实现了精确的安全控制,为基础模型适应多样化专业需求提供了实用路径。

**内容警告:**本文可能包含令人不适或有害的内容。

## 1 引言

随着大语言模型和视觉语言模型等基础模型被广泛部署(Zhang et al., 2024a(https://arxiv.org/html/2605.24154#bib.bib6);Li et al., 2025b(https://arxiv.org/html/2605.24154#bib.bib61);Tan et al., 2025(https://arxiv.org/html/2605.24154#bib.bib74);Liu et al., 2025(https://arxiv.org/html/2605.24154#bib.bib60)),安全对齐已成为一个重要的研究前沿(Qi et al., 2023(https://arxiv.org/html/2605.24154#bib.bib7);Yang et al., 2023(https://arxiv.org/html/2605.24154#bib.bib8);Li et al., 2024b(https://arxiv.org/html/2605.24154#bib.bib10);Ye et al., 2024(https://arxiv.org/html/2605.24154#bib.bib11);Tan et al., 2026(https://arxiv.org/html/2605.24154#bib.bib12))。安全对齐的目标是确保模型既乐于助人又无害:它们应遵循良性指令,同时拒绝有害或不恰当的指令。为此,安全对齐通常在训练期间强制执行一组预定义的通用安全规则(Ouyang et al., 2022(https://arxiv.org/html/2605.24154#bib.bib13);Yu et al., 2025(https://arxiv.org/html/2605.24154#bib.bib15);Sheng et al., 2025a(https://arxiv.org/html/2605.24154#bib.bib14)),结果就是一刀切的安全行为,对所有用户和情境一视同仁(Zhang et al., 2024b(https://arxiv.org/html/2605.24154#bib.bib1))。尽管这种策略在防止普遍危害方面取得了成功,但一刀切的对齐(Zhang et al., 2024b(https://arxiv.org/html/2605.24154#bib.bib1);Yuan et al., 2025(https://arxiv.org/html/2605.24154#bib.bib21))可能导致模型拒绝那些对普通公众被认为有害但在专业场景中合理的指令,从而损害有用性。例如,关于“尼帕病毒分离株”的查询对普通人来说可能存在安全风险,但对于开发诊断工具的疫苗研究人员来说却是合理的。要弥补这一差距,需要在不影响通用情况下标准安全对齐的前提下,有选择地放松对授权专业场景中目标域的拒绝行为。更广泛地说,这为模型提供商提出了一个实际问题:如何高效地向授权用户提供跨领域的、可区分的可控安全对齐?验证合法性是一个独立的挑战;在这里,我们专注于在上下文已被授权后调整模型行为。我们在图1(https://arxiv.org/html/2605.24154#S1.F1)中提供了更多示例。

先前解决这一约束的努力仍然有限。基于重新训练的方法(Guo et al., 2024(https://arxiv.org/html/2605.24154#bib.bib19);Zhang et al., 2024b(https://arxiv.org/html/2605.24154#bib.bib1))可以调整安全行为,但需要大量的偏好或响应数据以及针对不同安全需求的重复优化。无训练的激活引导方法(Lee et al., 2024(https://arxiv.org/html/2605.24154#bib.bib18);Wang et al., 2025b(https://arxiv.org/html/2605.24154#bib.bib20))通过应用拒绝方向到激活上提供了一种更轻量的替代方案,但它们需要手动选择干预层、方向和强度。这些选择会降低细粒度控制的准确性,导致要么在授权目标域上拒绝,要么在不相关的禁止域上意外服从,同时还引入了额外的推理时计算。在现实的个性化安全应用中,用户可能需要不同授权域的组合,这使得针对每个用户的重新训练或手动引导难以扩展,这些局限性变得更加明显。

为此,我们提出了**调色板**,一个用于基础模型中授权拒绝放松的模块化且高效的框架。**调色板**对拒绝方向执行多目标搜索,找出一个既能对齐用户目标域安全偏好又能保持实用性的方向。然后,它通过轻量级适配将该方向内化到模型参数中,从而在实现目标域安全行为的同时,保持无关域上的原始行为。最后,我们引入了基于难度的样本挖掘,以优先处理边界情况并减少意外的行为漂移。

**调色板**的一个关键实际优势在于其模块化设计,支持组合式的多域安全适应。在部署中,模型提供商可能需要服务具有异构授权范围的用户,每个用户涵盖不同的敏感领域子集。由于可能的授权配置文件数量随领域数量呈指数增长,为每个配置文件训练单独的模型或适配器是不切实际的。**调色板**提供了一种模块化替代方案:提供商可以一次性训练领域特定的安全适配器,然后通过简单的参数合并按需组合它们。这为个性化安全部署实现了一种可扩展且可审计的模型管理范式。

我们进行了全面的实验,展示了**调色板**的三个关键优势。首先,它在不同的基准测试、模型架构和模态中提供了强大的安全可控性,同时保持通用实用性。其次,我们的方法非常模块化和可组合:它支持模块化组合,通过合并单域控制实现多域控制,无需重新训练。第三,它也非常省资源,在单张RTX 4090上几分钟内即可适配一个7B规模的模型。总体而言,我们的工作为个性化安全适应提供了一种实用且有前景的解决方案。

参见图注

图1:授权目标域上期望的拒绝放松示例。

## 2 预备知识

在本节中,我们讨论工作的预备知识,包括引导技术的基础和问题定义。相关工作部分见附录A(https://arxiv.org/html/2605.24154#A1)。

### 2.1 通过激活引导移除拒绝

激活引导是一种新兴且有效的操纵大语言模型行为的方法。关键思想是在前向传播的选定层中,从模型激活中消融预定义的拒绝向量 **r**,从而获得该方向的抑制表示,进而减少模型的拒绝行为。形式化地说,这个引导过程可以定义如下:

\(\hat{\mathbf{h}}_l \leftarrow \mathbf{h}_l - \lambda \mathbf{r}_l,\) (1)

其中 \(\mathbf{h}_l\) 和 \(\hat{\mathbf{h}}_l\) 是块 \(l\) 处原始的和引导后的 \(d\) 维激活,\(\lambda\) 是控制引导强度的标量超参数,\(\mathbf{r}_l\) 是拒绝方向,通常通过均值差异法(Marks and Tegmark, 2023(https://arxiv.org/html/2605.24154#bib.bib42);Panickssery et al., 2023(https://arxiv.org/html/2605.24154#bib.bib43))计算服从和拒绝提示的激活均值差得到。在理想情况下,如果拒绝向量提取良好,这种方法允许大语言模型通过反转引导方向来可预测地服从指令(包括有害指令),而无需更改模型权重。当反转引导方向时,模型的输出行为从拒绝转向服从。关于如何推导 \(\mathbf{r}_l\) 的细节见附录B.3(https://arxiv.org/html/2605.24154#A2.SS3)。

### 2.2 个性化安全的问题定义

设 \(\mathcal{X}\) 表示指令空间。我们通过一个合法性集合 \(\mathcal{R}_U \subseteq \mathcal{X}\) 来形式化用户的个性化安全需求,同时还有一组预先存在的通用安全规则 \(\mathcal{R}_G \subseteq \mathcal{X}\)。为了对 \(\mathcal{X}\) 进行精确划分,我们将提示分为三个不相交的集合:

- • **安全提示** (\(\mathcal{P}_{\text{safe}} = \mathcal{R}_G \cap \mathcal{R}_U\)):在通用和个性化标准下都被视为良性和允许的指令。
- • **允许提示** (\(\mathcal{P}_{\text{allowed}} = \mathcal{R}_U \setminus \mathcal{R}_G\)):违反通用安全规则,但在用户特定的专业或情境背景下被视为合法的指令。
- • **禁止提示** (\(\mathcal{P}_{\text{disallowed}} = \mathcal{X} \setminus \mathcal{R}_U\)):超出用户合法性边界的指令,包括通用危害 ( \(x \notin \mathcal{R}_G \cup \mathcal{R}_U\) ) 和个人约束,即一个通常良性的请求与特定用户要求冲突 ( \(x \in \mathcal{R}_G \setminus \mathcal{R}_U\) )。

形式化地说,个性化安全对齐的目标是推导出一个最优决策函数 \(D: \mathcal{X} \to \{0,1\}\),完美恢复用户的合法性边界 \(\mathcal{R}_U\):

\[
D(x) = 
\begin{cases}
1 & \text{如果 } x \in \mathcal{R}_U \quad (\text{即 } x \in \mathcal{P}_{\text{safe}} \cup \mathcal{P}_{\text{allowed}}) \\
0 & \text{如果 } x \notin \mathcal{R}_U \quad (\text{即 } x \in \mathcal{P}_{\text{disallowed}})
\end{cases}
\tag{2}
\]

其中 \(D(x)=1\) 表示服从,\(D(x)=0\) 表示拒绝。

## 3 方法论

### 3.1 框架总体设计

在本节中,我们介绍**调色板**,一个用于可控、按需授权安全的模块化高效框架。**调色板**有选择地放松授权专业场景中目标域的拒绝行为以恢复有用性,同时在通用使用中保持标准安全对齐。该框架由三个主要组件组成。首先,在第3.2节(https://arxiv.org/html/2605.24154#S3.SS2)中,我们介绍了一种多目标搜索策略,用于识别一个平衡安全可控性和效用保持的拒绝方向。其次,在第3.3节(https://arxiv.org/html/2605.24154#S3.SS3)中,我们开发了一种权重内化策略,将个性化安全行为直接编码到模型参数中,并结合基于难度的样本挖掘策略以提高泛化能力并减少意外行为漂移。最后,在第3.4节(https://arxiv.org/html/2605.24154#S3.SS4)中,我们介绍了一种带有理论证明的参数合并方法,以实现对具有异构授权范围和安全偏好的用户的组合式安全控制。整体框架如图2(https://arxiv.org/html/2605.24154#S3.F2)所示。

参见图注

图2:**调色板**概览,主要包括三个步骤:生成拒绝方向候选、对拒绝方向进行多目标搜索,以及通过适配进行内化调整。

### 3.2 对拒绝方向进行多目标搜索

为了自动选择适当的拒绝方向,我们首先使用第2.1节(https://arxiv.org/html/2605.24154#S2.SS1)中讨论的激活均值差异法,收集候选方向池 \(\mathcal{R} = \{ \mathbf{r}_1, \mathbf{r}_2, \dots, \mathbf{r}_k \}\)。我们的关键见解是,消融不同的候选方向会引发不同的行为效果:它们不仅会导致目标提示上不同程度的服从度变化,还会对通用行为产生不同程度的影响。一些方向会显著推动 \(\mathcal{P}_{\text{allowed}}\) 向服从方向移动,同时保持效用,而其他方向要么只引起有限的行为变化,要么在 \(\mathcal{P}_{\text{disallowed}}\) 上导致不良漂移。因此,我们通过一个多目标优化框架寻找一个方向,以平衡个性化安全控制和通用模型效用。

第一个目标是安全控制,旨在最大化 \(\mathcal{P}_{\text{allowed}}\) 的服从度,同时抑制 \(\mathcal{P}_{\text{disallowed}}\) 上意外的服从度变化。我们使用绕过分数(期望的非拒绝概率)来量化这种行为。在 \(\mathcal{P}_{\text{allowed}}\) 和 \(\mathcal{P}_{\text{disallowed}}\) 上的分数分别记为 \(P_A(r)\) 和 \(P_D(r)\)。我们定义 \(P_A(r)\)

相似文章

多智能体LLM安全中的操作重构与批准框架委托

arXiv cs.AI

本文引入了一种五条件控制对比设计,以区分多智能体LLM安全评估中操作重构、规划器行为和批准框架委托的影响,表明整体流水线安全度量不能解释为稳定的架构属性。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性

arXiv cs.AI

本文提出了一个混合框架,结合一阶安全对齐与零阶微调,以增强LLM安全对齐在受到对齐后扰动时的鲁棒性。理论和实验结果表明,仅需少量微调步骤即可在保持安全性的同时提升鲁棒性。