Fence:面向LLM应用的专用SLM护栏
摘要
Fence提出使用在高质量合成数据上训练的小语言模型作为LLM应用的专用护栏,展示了相对于基于提示的LLM护栏的性能提升。
arXiv:2607.18268v1 Announce Type: new
摘要:实际应用中使用的闭源大型语言模型需要超越基本内容过滤器的先进安全措施。内容审核过滤器(如毒性和偏见)具有相对标准的定义,而应用特定的护栏(如幻觉、主题漂移和行为偏差)则更难以建模,并可能因用例而异。此外,数据稀缺和标注成本使得创建和测试专用护栏的过程具有挑战性。在这项工作中,我们提出使用在合成数据上训练的小语言模型作为LLM应用的专用护栏。我们引入了一种受生成对抗网络设计启发的新型合成数据生成方法,以生成高质量的合成数据样本,用于训练SLM编码用例特定的护栏信息,从而使其充当专用护栏。我们的实验表明,在高质量合成数据上训练的SLM护栏相对于基于提示的LLM护栏展现出性能提升。
查看缓存全文
缓存时间: 2026/07/22 08:21
# Fence:面向LLM应用的专业化SLM护栏
来源: https://arxiv.org/html/2607.18268
###### 摘要
使用闭源大语言模型(LLM)的真实世界应用需要超越基础内容过滤器的先进安全措施。像毒性和偏见这类内容审核过滤器具有相对标准的定义,而应用特定的护栏(如幻觉、主题偏离和行为偏差)则更难建模,且可能因用例而异。此外,数据稀缺和标注成本使得创建和测试专业化护栏的过程充满挑战。在这项工作中,我们提出使用在合成数据上训练的小语言模型(SLM)作为LLM应用的专业化护栏。我们引入了一种受生成对抗网络(GAN)设计启发的新型合成数据生成方法,用于生成高质量合成数据样本,这些样本可用于训练SLM编码特定用例的护栏信息,从而充当专业化护栏。我们的实验表明,在高质量合成数据上训练的SLM护栏相较于基于提示的LLM护栏展现出性能提升。
Fence:面向LLM应用的专业化SLM护栏
††本文由摩根大通公司及其附属机构("摩根大通")机器学习卓越中心小组为信息目的编写,并非摩根大通研究部门的产品。摩根大通不对此处信息的完整性、准确性或可靠性作出任何陈述和保证,并否认所有责任。本文档不构成投资研究或投资建议,也不构成购买或出售任何证券、金融工具、金融产品或服务的推荐、要约或招揽,也不应以任何方式用于评估参与任何交易的价值,也不应在任何司法管辖区或对任何人构成招揽(如果在该司法管辖区或对该人进行此类招揽将是非法的)。
## 1 引言
LLM驱动的应用被广泛人群使用的激增使其安全性成为紧迫问题。当LLM被用于高度专业化或定制化任务时,需要针对每个任务的独特要求开发特定的护栏。虽然商业LLM(如GPT、Claude和Gemini)配备了内置内容过滤器,提供了基础安全层,但要确保全面保护,还需要在这些默认机制之上实施额外的、专业化的护栏。迄今为止,大部分关注点都集中在以模型为中心的安全性上;然而,确保使用这些LLM的下游应用在安全和负责任的边界内运行同样重要。这一要求适用于所有将LLM用于特定领域或任务导向目的的应用。
为了解决使用LLM作为评判者范式(Verga 等人,2024 (https://arxiv.org/html/2607.18268#bib.bib4))实现护栏时的延迟和成本瓶颈,近期研究探索了使用合成数据进行安全蒸馏以训练SLM(Gudibande 等人,2023 (https://arxiv.org/html/2607.18268#bib.bib5)),但这些工作并未关注高度专业化的护栏或针对安全的合成数据生成方法。此外,常见的合成数据生成技术(如Self-Instruct(Wang 等人,2023 (https://arxiv.org/html/2607.18268#bib.bib6)))通常生成的样本缺乏对抗性复杂度,无法稳健地检测自定义护栏违规的隐秘实例。虽然一些工作(Perez 等人,2022 (https://arxiv.org/html/2607.18268#bib.bib7))引入了对抗性提示来压力测试模型,但仍然缺乏能够生成高质量专业化安全数据的方法来训练稳健的SLM护栏。现有的基准如Toxigen (Hartvigsen 等人,2022 (https://arxiv.org/html/2607.18268#bib.bib8); Bassani and Sanchez, 2024 (https://arxiv.org/html/2607.18268#bib.bib9); Gehman 等人,2020 (https://arxiv.org/html/2607.18268#bib.bib10)) 侧重于普遍性危害(如仇恨言论和暴力)。然而,针对特定用例的危害(如主题偏离或行为偏差)的研究有限。例如,金融机器人需要与创意写作机器人不同的主题边界。当前围绕LLM的内容过滤器是带有固定定义的黑箱,需要在其之上添加额外的定制化护栏。在这项工作中,我们提出使用LLM模拟的部分GAN设置来生成对抗性合成数据,这些数据可用于将特定领域约束编码到SLM中,从而解决策略僵化问题。虽然一个模型按照传统标准可能被认为是"安全的",但在特定业务逻辑或领域要求的上下文中,它仍然可能是有"害的"。因此,开发不仅稳健而且能适应各个应用程序细微需求的护栏至关重要。
通过我们提出的方法,我们能够利用对抗性合成数据为任意策略构建护栏,促进快速策略原型设计和调整。这种方法将重点从LLM的通用安全保护转移到利用这些模型的下游用例的专用护栏开发。通过采用受GAN启发的合成数据生成流水线,我们可以快速生成SLM的训练数据,从而在不需大量重新收集数据的情况下高效更新护栏策略(Inan 等人,2023 (https://arxiv.org/html/2607.18268#bib.bib2))。
我们的工作提出了一个新颖的框架,用于生成高质量的、特定领域的合成数据,并训练SLM作为专业化护栏。这为LLM驱动的应用提供了灵活、快速且稳健的安全解决方案,解决了现有内容过滤器的局限性以及实际部署中策略僵化的挑战。
请参阅说明图1:合成数据生成流水线
## 2 相关工作
NeMO-Guardrails (Rebedea 等人,2023 (https://arxiv.org/html/2607.18268#bib.bib1)) 和 Llama-guard (Inan 等人,2023)(https://arxiv.org/html/2607.18268#bib.bib2)是一些最流行的护栏解决方案,允许使用SLM作为护栏。NeMO主要侧重于Colang逻辑,而不是一种稳健的自动生成高质量对抗性数据的方法。这种SLM护栏依赖于从LLM输出或人工标注数据中蒸馏,这常常导致对抗性样本的标签稀缺。Meta的Llama-guard-3针对速度进行了高度优化,但仅限于广泛的、预定义的安全分类法,而非广泛的应用特定策略。
Dong 等人(2024)(https://arxiv.org/html/2607.18268#bib.bib11) 提出了神经符号护栏,可以针对特定任务进行微调,展示了较小模型在强制实施细微安全约束方面的有效性。Zhan 等人(2025)(https://arxiv.org/html/2607.18268#bib.bib20) 表明,经过微调用于审核的SLM在速度和准确性方面可以超越LLM,用于实时内容过滤。然而,他们的主要关注点是标准审核任务(如毒性和偏见)。他们还依赖带注释的数据集,限制了适应数据稀缺的更小众用例的能力。Nakka 等人(2025)(https://arxiv.org/html/2607.18268#bib.bib21) 提出了LiteLMGuard,这是一个基于合成数据训练的SLM护栏系统。这项工作主要关注提示过滤和标准安全风险,而应用特定的护栏(如幻觉和主题偏离)则未被覆盖。Ilin 等人(2025)(https://arxiv.org/html/2607.18268#bib.bib12) 使用通过GAN启发、RL引导的对抗过程生成的合成数据来训练SLM作为安全护栏。该方法扩充和改写人工策划的种子数据,然后使用生成器-判别器循环(以SLM作为判别器)来创建具有挑战性的对抗性数据样本。虽然对毒性和危害性等一般安全风险有效,但该方法不针对特定用例的行为(如幻觉、主题偏离和行为偏差)。相比之下,我们的合成数据生成方法专门针对细微的、特定用例的护栏,利用LLM确保更高质量的数据样本。
近期工作也关注合成数据生成的新方法。虽然现有数据集如 AdvBench (Zou 等人,2023)(https://arxiv.org/html/2607.18268#bib.bib13) 和 Mazeika 等人(2024)(https://arxiv.org/html/2607.18268#bib.bib14) 专门用于评估LLM的安全性和稳健性,但它们通常完全由人工策划的数据组成和/或侧重于通用护栏,无法满足特定用例的安全需求。Li 等人(2024)(https://arxiv.org/html/2607.18268#bib.bib15) 提出了一个生成对抗性提示的框架,可以暴露LLM中的安全弱点。该方法利用基于梯度的优化来制作可能引发模型不安全或非期望响应的提示。然后使用生成的提示通过对抗性训练来评估和改进LLM的安全性。该论文表明,在提出的流水线生成的合成数据上训练的模型对多种对抗性攻击表现出更强的稳健性。这项工作展示了合成数据在训练SLM作为专业化护栏方面的有效性。Xie 等人(2025)(https://arxiv.org/html/2607.18268#bib.bib16) 引入了一个基准,专门评估LLM和SLM生成道歉响应的能力,这对于实际应用中的安全和用户信任至关重要。数据集包括各种场景,其中道歉或拒绝是适当的响应,并系统地测量模型安全且适当地响应的能力。数据通过结合人工策划、现有数据集聚合、语言变异(如改写、使用俚语和逻辑诉求)以及LLM生成响应的过程生成。Huang 等人(2024)(https://arxiv.org/html/2607.18268#bib.bib3) 表明,通用安全模型难以检测特定应用场景中的"危害"。这些模型能够检测明显的危害,但无法检测巧妙的策略违规。
其他工作路线(https://arxiv.org/html/2607.18268#bib.bib17; M. Mazeika, L. Phan, X. Yin, A. Zou, Z. Wang, N. Mu, E. Sakhaee, N. Li, S. Basart, B. Li, D. Forsyth, and D. Hendrycks, 2024 (https://arxiv.org/html/2607.18268#bib.bib14))探索了自动红队测试,其中LLM生成对抗性提示以探测现有LLM系统中的漏洞,并使用LLM作为评判者设置来评估模型对提示的响应,判断是否成功暴露了特定漏洞。这些方法往往是一次性启发式的,缺乏可迁移性。此外,没有真实数据,红队测试结果缺乏可信度。我们的合成数据生成方法通过优先考虑分布保真度来补充(而非重复)自动红队测试工作,并提供高质量的阳性样本,可用于辅助红队测试练习。
## 3 合成数据生成
微调SLM护栏的主要挑战之一是缺乏阳性样本,即对抗性数据。人工标注昂贵且耗时,而有效训练SLM所需的数据规模通常难以标注。使用LLM生成合成数据是一种可行的选择,但难以确保这些数据在语义和分布上与真实用例数据相似 (El-Hajjami and Salinesi, 2026 (https://arxiv.org/html/2607.18268#bib.bib19); Shumailov 等人,2024 (https://arxiv.org/html/2607.18268#bib.bib18))。为了解决这一挑战,我们提出使用双模型设置,其中一个模型(生成器)生成合成数据,而另一个模型(判别器)试图区分合成数据和真实数据。
我们提出一种受GAN启发、基于LLM的合成数据生成方法。下面,我们首先定义关键组件和操作模式,然后描述整体流水线。我们的合成数据生成过程包括三个主要组件:生成器 GG、判别器 DD 和优化器 OO。
#### 关键组件
- •**生成器**:一个负责生成合成数据样本的LLM。它接收两个输入:(1) **种子数据**,一组来自目标用例的安全、代表性样本;(2) **护栏定义**,护栏目标的全面自然语言规范,包括其主要目的、任何相关主题范围以及预期的行为指南。
#### 生成模式
- – **自由生成**:生成器根据种子数据和护栏定义生成全新样本,不直接修改任何现有示例。
- – **对抗性扩增**:生成器创建输入种子数据的变体,故意扰动它们以探测护栏的边界,同时保持真实感。
- •**判别器**:一个单独的LLM,负责区分真实数据和合成生成的数据。关键的是,判别器**不**评估样本是否违反护栏;其唯一目标是将每个样本分类为“真实”或“合成”,并为此分类提供自然语言理由。
- •**优化器**:优化器负责从判别器获取文本梯度,并将其解释为信号以更新生成器的提示。文本梯度是判别器产生的自然语言理由。类似于传统GAN中的数值梯度,这些推理输出被反馈到生成器的提示中,以迭代地改进后续合成样本的质量和真实感。
### 过程
- •**生成器**:生成器 GG 根据提示 pp 和特定用例的护栏定义 δ\\delta 生成候选合成样本 xsynx_{\text{syn}}: xsyn=G(p,δ)x_{\text{syn}}=G(p,\delta)
- •**判别器**:判别器 DD 接收真实样本 xrealx_{\text{real}} 和合成样本 xsynx_{\text{syn}},并输出每个样本的标签 D(x)∈[real,fake]D(x)\in[real,fake],指示 xx 是真实还是合成。我们强制执行一个条件:DD 输出的标签必须是互斥的,并且 DD 被告知所提供的两个样本中,一个肯定是真实的,另一个是合成的。除了标签外,DD 还生成一个推理轨迹 r(x)r(x),详细说明影响其决策的特征。
- •**推理轨迹聚合**:每轮生成后,推理轨迹 r(xreal)r(x_{\text{real}}) 和 r(xsyn)r(x_{\text{syn}}) 被附加在一起聚合,并总结以提取关键的判别特征:
- – ShelpfulS_{\text{helpful}}:使 DD 能够正确识别合成数据的特征。
- – SconfusingS_{\text{confusing}}:导致 DD 将合成数据误分类为真实数据的特征。
- •**优化器**:优化器 OO 通过最大化后续生成中 SconfusingS_{\text{confusing}} 的存在并最小化 ShelpfulS_{\text{helpful}} 来更新生成器提示 pp。形式上,迭代 tt 时的提示更新为: pt+1=O(pt,Shelpful,Sconfusing)p_{t+1}=O\left(p_{t},S_{\text{helpful}},S_{\text{confusing}}\right)相似文章
CHILLGuard:面向细粒度中文大模型安全护栏的可扩展数据构建与模型感知偏好对齐
本文介绍了CHILLGuard,一个基于新的5大类、31小类风险分类体系和可扩展多阶段数据构建流程的细粒度中文大模型内容安全护栏。该模型实现了最先进的性能,在F1分数上相比现有基线提升了15.92%。
SingGuard: 策略自适应多模态LLM护栏与动态推理
SingGuard是一种策略自适应多模态LLM护栏模型,用于文本、图像和多语言安全审核,具备动态推理能力,并包含新基准SingGuard-Bench。它在多个数据集上取得了最先进的结果。
@amitiitbhu:LLM 护栏如何工作?在此阅读:
一份实用指南,解释 LLM 护栏的工作原理、为什么需要它们、它们在输入和输出上的位置、如何用代码实现它们,以及最佳实践。
DT-Guard: 意图驱动的推理主动训练实现免推理的LLM安全护栏
DT-Guard提出了一种推理主动训练、免推理推理的范式,用于LLM安全护栏。使用4B主干模型在安全基准测试中取得了强F1分数,超越更大的基线模型。
具备潜在推理能力的鲁棒高效护栏
CoLaGuard 是一种新型护栏模型,它将多步安全推理转移到连续潜在空间中,与显式推理基线相比,实现了 12.9 倍的加速和 22.4 倍的 Token 缩减,同时在十个安全基准上匹配宏 F1 性能。