一种用于数据高效 RL 对齐的宪法网格工具(C-Guard)

arXiv cs.CL 论文

摘要

本文提出了 C-Guard,一种用于安全护栏数据高效强化学习对齐的宪法网格工具,利用 C-LIM 可学习性评分来修剪、加密、修正或扩展训练数据。它将过度拒绝从 22.4% 降低到 12.8%,并提高了数据效率。

arXiv:2608.00180v1 公告类型:新 摘要:冲突目标在 RL 对齐中普遍存在,而在这些目标上进行数据高效的训练是困难的。使用 RL 训练安全守卫意味着要优化两个相互冲突的目标:捕捉真实危害,同时不拒绝良性提示。我们的发现是,过度拒绝从 22.4% 改善到 12.8%,而对对抗性攻击的拒绝不足却从 0.27 悄然恶化到 0.33。我们提出了 C-Guard,一种生成 RL 训练数据的宪法网格工具,以及 C-LIM,一种决定每个单元格操作(剪枝、加密、修正、扩展)的逐单元格可学习性评分。C-LIM 在花费任何训练预算之前就标记出无效数据区域:187 个非目标行此前未带来任何收益,而我们的方法将同一区域的学习影响从 0.733 提升到 0.80。代码和宪法均已开源。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:38

###### 摘要

强化学习对齐中普遍存在目标冲突,而要在数据高效的前提下进行训练并非易事。训练一个安全守卫模型意味着优化两个相互冲突的目标:捕捉真实危害,同时不拒绝良性提示。我们的研究发现:过度拒绝从22.4%改善到12.8%,而在对抗性攻击上的漏拒却从0.27悄然恶化到0.33。我们提出了**C-Guard**,一种宪法网格工具,用于生成RL训练数据;以及**C-LIM**,一种逐单元格可学习性评分,决定每个单元格的处置方式:剪枝、加密、修订或扩展。C-LIM在任何训练预算投入之前就会标记出无效数据区域:187行无目标的行没有带来任何收益,而我们的方法将同一区域的学习影响从0.733提升到0.80。代码和宪法均已开源。¹¹¹代码:https://github.com/genius-researcher/c-guard。项目网站:https://colm2026-c-guard.vercel.app/。

## 1 引言

参见图1:宪法棋盘。行是宪法的危害主题,列是提问方式。逐单元格的可学习性读数给每个单元格着色,并将其分配到一种处置方式。模型在结果上训练,下一个检查点会被重新读取。许多RL对齐问题需要训练两个相互对抗的目标(Bai et al.,2022b (https://arxiv.org/html/2608.00180#bib.bib2);a (https://arxiv.org/html/2608.00180#bib.bib1))。安全守卫就是一个很好的例子,因为安全守卫分类的需求很高:在OpenRouter上,分类是最大的单一任务,占总花费的9.0%和总token的6.9%(OpenRouter,2026 (https://arxiv.org/html/2608.00180#bib.bib11))。守卫读取LLM接收的每一条提示,必须捕捉真实危害,同时不拒绝良性请求。我们的4B基线将*我如何在《使命召唤》里杀个人?*标记为不安全,因为它只看到了触发词*kill*,并阻止了22.4%的良性提示(Röttger et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib13))。相反的失败模式意味着一个伪装成小说或角色扮演的有害请求能通过同一个基准(Han et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib6))。

标准的修复方法是增加更多边界数据(Han et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib6); Cui et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib3)),但没有目标的盲目增加数据是浪费的(Diddee & Ippolito,2024 (https://arxiv.org/html/2608.00180#bib.bib4))。我们为我们最薄弱的主题添加了187行数据,其准确率增益为0。更糟糕的是,如果XSTest是唯一的参考测试集(Röttger et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib13)),数据投入就会是单边的。它只评估过度拒绝,在另一个维度上几乎保持平坦,因此训练可能会偏向一侧,同时为被错过的攻击付出隐形代价。问题在于如何通过测量来引导每一个数据操作,以及如何同时看到两个目标。我们构建了一个宪法网格来对覆盖度进行测量:每一行新数据都落在棋盘显示存在学习余量的地方,这正是让RL训练数据高效的原因。

我们将守卫数据生成视为在宪法棋盘上执行操作:我们编写一部宪法,每个危害主题一条策略,并将其主题与用户的提问方式交叉(图1 (https://arxiv.org/html/2608.00180#S1.F1))。C-LIM是一种改编自学习影响测量(Li et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib8))、在未见数据行上计算的逐单元格可学习性评分,它读取棋盘并决定每个单元格的操作:剪枝一个已掌握的单元格,加密一个仍在学习的单元格,修订一个规则错误的单元格,或扩展棋盘添加一个新主题。每一次生成都会用于GRPO(Shao et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib15))的RL训练,每个增益都在训练后的模型上进行测量。

#### 我们的贡献是:

1. 1. 宪法网格驱动数据覆盖:读取单元格可学习性,将每个单元格路由到一种操作,用RL训练。有针对性的生成将标记区域的学习影响从0.733提升到0.80。
2. 2. 两种测量:C-LIM在任何预算投入之前就标记出无效数据。双通道读数揭示了漂移代价:过度拒绝从22.4%改善到12.8%,而对抗性漏拒从0.27悄然恶化到0.33。
3. 3. 对操作设置可执行的门控。该门控拒绝了一个过度扩展的修订,以及一个自身获益但损害棋盘其余部分的新主题。

没有任何先前的守卫模型同时结合了宪法策略数据、逐单元格探针瞄准、实时攻击通道和RL(表1 (https://arxiv.org/html/2608.00180#S1.T1))。最接近的是Calibrated Reasoning(Garg et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib5)),它用RL训练了一个推理模型,但在推理时校准验证器而不是训练数据。

方法 | 策略数据 | 探针瞄准 | 攻击通道 | RL
LlamaGuard (Inan et al.,2023 (https://arxiv.org/html/2608.00180#bib.bib7)) | ✗ | ✗ | ✗ | ✗
WildGuard (Han et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib6)) | ✗ | ✗ | ✗ | ✗
OR-Bench (Cui et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib3)) | ✗ | ✗ | ✗ | ✗
GuardReasoner (Liu et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib10)) | ✗ | ∼ | ✗ | ∼
RSafe (Zheng et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib18)) | ✗ | ✗ | ✗ | ✓
HaloGuard (Sangameswaran et al.,2026 (https://arxiv.org/html/2608.00180#bib.bib14)) | ✓ | ✗ | ∼ | ✗
Const. Classifiers (Sharma et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib16)) | ✓ | ✗ | ∼ | ✗
Calibrated Reasoning (Garg et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib5)) | ✗ | ✗ | ✗ | ✓
C-Guard (ours) | ✓ | ✓ | ✓ | ✓

表1:C-Guard所处的位置,∼表示部分机制。GuardReasoner通过困难样本挖掘进行瞄准,并使用DPO(Rafailov et al.,2023 (https://arxiv.org/html/2608.00180#bib.bib12))进行调优。HaloGuard的攻击侧是静态增强。Constitutional Classifiers只进行一次红队测试。Calibrated Reasoning用RL训练推理模型,但在推理时校准验证器而不是训练数据。C-Guard逐单元格瞄准,并在每个检查点重新测量攻击。

## 2 方法

宪法网格有一个自动循环:它接收一个检查点,输出有方向性的训练行。我们读取棋盘,执行操作,训练模型,然后迭代(图2 (https://arxiv.org/html/2608.00180#S2.F2))。共有四种操作:剪枝一个已掌握的单元格,加密一个仍在学习的单元格,修订一个规则错误的单元格,扩展棋盘以添加一个新主题。

参见图2:读取棋盘。每个单元格都在未见行上评分,其得分决定操作。

### 2.1 先读取,再行动

参见图3:根据读数行动。(a) 左:剪枝+扩展。(b) 右:围绕边界加密,在两侧添加行,使任何旧标签都不会翻转,先例翻转为零。

宪法是每个危害主题一条策略(Bai et al.,2022a (https://arxiv.org/html/2608.00180#bib.bib1); Sharma et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib16); Sangameswaran et al.,2026 (https://arxiv.org/html/2608.00180#bib.bib14)),每个条款画出一条安全与不安全之间的分界线。其主题与用户的提问方式交叉构成棋盘。生成器在每个条款边界生成一个安全孪生和一个不安全孪生(表2 (https://arxiv.org/html/2608.00180#S2.T2))。孪生对共享触发词,仅翻转意图(Röttger et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib13)),因此守卫必须学习边界而不是词汇。

为了读取一个单元格的可学习性,我们在每个检查点对未见行进行8次模型采样,然后根据标签对通过率打分。每个标签在构造上都是固定的,并追溯到条款。C-LIM对轨迹打分:对于单元格cc,在检查点kk处的平均通过率为rckr_{c}^{k},领域均值为r̄k\bar{r}^{k},

sc=1−∑k(rck−r̄k)2∑k(1−r̄k)2.s_{c}=1-\frac{\sum_{k}\left(r_{c}^{k}-\bar{r}^{k}\right)^{2}}{\sum_{k}\left(1-\bar{r}^{k}\right)^{2}}. (1)

一个跟随领域趋势的单元格得分接近1。一个保持平坦而领域在上升的单元格会得很大的负数,即无效数据。与LIMR(Li et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib8))不同——它给训练样本打分以选择子集——C-LIM是在模型从未训练过的行上对网格单元格打分,因此该得分诊断的是棋盘的一个区域。两种操作直接跟随得分(图3 (https://arxiv.org/html/2608.00180#S2.F3)):(1) 剪枝一个已掌握的单元格(得分接近1):不再生成任何内容,将其行保留为留存集。(2) 加密一个仍在学习的单元格(得分上升):在相同规则下添加更多行。

### 2.2 攻击然后修订

参见图4:攻击然后修订。(a) 左:攻击棋盘。(b) 右:宪法修订。

表2:孪生对示例,每个主题一对。

每个单元格都从两个方向读取。良性通道检查安全的近似句能否通过,攻击通道检查同一风格下伪装的有害提示是否被拦截(Han et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib6)),从而揭示良性通道无法看到的覆盖缺口。当攻击通道显示某个规则错误时,修订操作会编辑宪法文本(图4 (https://arxiv.org/html/2608.00180#S2.F4))。修订必须通过先例翻转回归,即重新判定已确定的行;并且它以配对数据的形式发布:攻击捕获及其安全孪生,从而使更尖锐的边界不会拒绝合法请求。XSTest(Röttger et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib13))保持在循环之外作为只读参考,这让第3节 (https://arxiv.org/html/2608.00180#S3)能够在模型从未训练过的数据上测量漂移代价。

### 2.3 扩展棋盘

参见图5:扩展棋盘。(a) 左:细分网格。(b) 右:宪法扩展。

两种操作用于扩展棋盘(图5 (https://arxiv.org/html/2608.00180#S2.F5))。新主题必须通过收益门控:它能够学习,全局得分不倒退,且没有现有主题下降。第3节 (https://arxiv.org/html/2608.00180#S3)展示了该门控的一次拒绝和修订门控的一次拒绝。(1) 细分处理停滞的单元格:当更多行不再有帮助时,沿新的局部轴分解该单元格。(2) 扩展在覆盖缺口没有可归属主题时添加一个主题行,这是唯一添加行的操作。

### 2.4 RL训练

我们从Nemotron-Content-Safety-Reasoning-4B(Sreedhar et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib17))出发,这是一个在输出安全或不安全标签之前进行推理的安全守卫,且仅经过SFT训练。目标是在这个SFT基线上添加RL,使其更好地推理,遵循RSafe和GuardReasoner的方法(Zheng et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib18); Liu et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib10))。它作为SFT基线是正确的,原因有二。它的推理使rollout产生多样性,因此RL拥有一个仅输出类别的分类器不会提供的梯度。而且它的错误是单边的过度拒绝,这是有修复余量的一侧。配方刻意保持朴素:使用带规则奖励的普通GRPO(Shao et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib15)),

π∗=arg⁡maxπ Ex∼D,c∼π[R(c,x)],R=1[answer matches label]−0.2⋅1[format invalid].\pi^{*}=\arg\max_{\pi}\ \mathbb{E}_{x\sim D,\,c\sim\pi}\big[R(c,x)\big],\qquad R=\mathbb{1}[\text{answer matches label}]-0.2\cdot\mathbb{1}[\text{format invalid}]. (2)

标签只从推理轨迹之后的答案槽中读取,因此一次rollout不能同时输出两个标签;标签泄漏到推理中会招致格式惩罚。所有样本都一致的rollout组梯度为零,会被在线丢弃,这将计算集中在模型仍然不一致的提示上。

## 3 结果

有帮助性与无害性相互拉扯,我们在两个维度上读取守卫,报告四项能力:(1) 训练前哪些数据是无效的,(2) 单边记分板隐藏的漂移代价,(3) 有针对性的覆盖如何提升一个被标记的单元格,(4) 让冒险操作保持安全的各种门控。

#### 设置。

基线是Nemotron-Content-Safety-Reasoning-4B(Sreedhar et al.,2025 (https://arxiv.org/html/2608.00180#bib.bib17)),仅SFT。XSTest(Röttger et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib13))是记分板,450条提示,使用贪婪解码(附录B (https://arxiv.org/html/2608.00180#A2))。漏拒在WildGuardTest(Han et al.,2024 (https://arxiv.org/html/2608.00180#bib.bib6))上测量,这是一个独立的人工标注集,包含对抗性和普通切片。语料库从约2K行增长到最终迭代时的7,241行,每个数据包都可追溯到一次探针发现或一次修订。

### 3.1 无效数据诊断

参见图6:读取棋盘。(a) Privacy保持平坦而领域在上升。(b) 每个单元格的C-LIM,privacy是−11.9-11.9的异常值。C-LIM在任何训练预算投入之前就标记出无效区域(图6 (https://arxiv.org/html/2608.00180#S3.F6))。在检查点阶梯上,21个被评分的单元格中有20个健康地聚集,而privacy|public-vs-private在领域升至0.98时仍保持平坦在0.80,C-LIM为−11.9-11.9,而第二差的单元格为−0.33-0.33。这与一个人类几周前就丢弃为无效数据的privacy数据包相符。基线的错误恰好集中在这个家族中(附录C (https://arxiv.org/html/2608.00180#A3))。盲目的数据量显示了错过它的代价:在没有目标信号的情况下向该家族添加187行数据,准确率变化为0.000。

表3:SFT基线对比RL成品。过度拒绝下降9.6个点,配对一致性上升12个点,而漏拒几乎不动,且不增加测试时成本。

### 3.2 漂移代价

参见图7:记分板对漂移代价视而不见。过度拒绝(左)在所有地方改善,而漏拒(右)在独立切片上恶化,记分板几乎不动。RL将XSTest过度拒绝从22.4%降至12.8%,而记分板的漏拒几乎不动,因此边界看起来稳定(图7 (https://arxiv.org/html/2608.00180#S3.F7))。在两个独立集合上,同样的转移讲述了故事的另一半:过度拒绝在所有地方下降,但漏拒在每个独立切片上都上升,最严重的是WildGuardTest的对抗性提示。一个维度是记分板的胜利,另一个是隐藏成本,只有第二通道和独立集合才能揭示它。由于WildGuardTest和ToxicChat(Lin et al.,2023 (https://arxiv.org/html/2608.00180#bib.bib9))(带有真实用户流量和人工标签)都呈现相同的形状,漂移代价是系统性的边界偏移,而不是我们生成器的假象。附录表4 (https://arxiv.org/html/2608.00180#A1.T4)给出了每个评估的数值。

参见图8:收益门控拒绝了一个损害棋盘的新主题。新主题自身在学习(门控G1通过),但全局平衡准确率从0.944倒退到0.916(G2失败),且privacy和discrimination出现负迁移(G3失败),因此门控拒绝它。

### 3.3 有针对性的覆盖

有针对性的生成提升了一个盲目数据量无法提升的被标记单元格。privacy家族在187行无目标数据下平坦在0.733,一旦行针对其探测出的失败模式——虚构角色的个人信息和真实熟人的受保护属性——其数值提升到0.80。这是有帮助性维度上覆盖到学习的连接。在对抗性维度上消除漂移代价是一个开放的前沿,将在第4节 (https://arxiv.org/html/2608.00180#S4)讨论。

### 3.4 安全护栏

改变规则的操

相似文章

具备潜在推理能力的鲁棒高效护栏

arXiv cs.AI

CoLaGuard 是一种新型护栏模型,它将多步安全推理转移到连续潜在空间中,与显式推理基线相比,实现了 12.9 倍的加速和 22.4 倍的 Token 缩减,同时在十个安全基准上匹配宏 F1 性能。

SingGuard: 策略自适应多模态LLM护栏与动态推理

Hugging Face Daily Papers

SingGuard是一种策略自适应多模态LLM护栏模型,用于文本、图像和多语言安全审核,具备动态推理能力,并包含新基准SingGuard-Bench。它在多个数据集上取得了最先进的结果。