Regime-Conditional Verification: 用于调整和监控安全分类器的正确性估计

arXiv cs.AI 论文

摘要

本文介绍了Regime-Conditional Verification (RCV),这是一个轻量级包装器,通过估计预测正确性并检测分布偏移,无需重新训练即可调整用于大型语言模型的现成安全分类器。

arXiv:2608.14089v1 Announce Type: new 摘要:与大型语言模型一起部署的安全分类器经常因两个原因失败:它们的决策反映的是训练期间学到的策略,而不是部署者期望的策略;并且随着部署流量的发展,它们的性能会下降。我们提出了Regime-Conditional Verification (RCV),这是一个轻量级包装器,可以在不重新训练的情况下调整现成的安全分类器。RCV从分类器的内部表示中估计每个预测与部署者策略不一致的概率,并选择性地纠正可能错误的预测。相同的正确性估计也提供了检测分布偏移的无标签信号,使得维护循环可以更新正确性估计层,并仅在必要时求助于分类器微调。在三个现成安全分类器和两个基准数据集上,RCV在每个分类器-数据集组合中都提高了对部署者策略的遵守程度,在不修改底层分类器的情况下,捕获了之前遗漏的不安全内容的81%。在一项部署研究中,使用了十次攻击活动,每次活动都是RCV训练中未包含的损害类别,RCV在专用注入面板中检测到了每一次活动;在维护统计中,大多数漂移事件无需更新分类器即可修复,微调仅保留用于修复无法恢复的残余事件。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:04

# 适应与监控安全分类器的正确性估计  
来源:https://arxiv.org/html/2608.14089  
## 基于规则条件的验证:适应与监控安全分类器的正确性估计  
致谢:本研究由 MURI 项目 *Foundations of Dynamic Certification for Autonomy*(ONR N00014-25-1-2479)资助。

###### 摘要  
与大型语言模型共同部署的安全分类器通常因两种原因失效:其决策反映的是训练时学到的策略而非部署者期望的策略,且性能随部署流量演化而下降。我们提出 **基于规则条件的验证**(RCV),一种无需重新训练即可适配现成安全分类器的轻量级封装方法。RCV 从分类器的内部表征中估计每个预测与部署者策略不一致的概率,并选择性地纠正可能错误的预测。相同的正确性估计也为分布偏移检测提供无标签信号,从而建立维护循环:更新正确性估计层,仅在必要时才对分类器进行微调。在三种现成安全分类器和两个基准数据集上的实验表明,RCV 在所有分类器-数据集组合中均提升了对部署者策略的遵循度,无需修改底层分类器即可捕获高达 **0.81** 之前未识别的不安全内容。在针对十个攻击活动(每个活动均为 RCV 训练中排除的危害类别)的部署研究中,RCV 在专用注入面板中检测到所有攻击;在维护评估中,大多数漂移事件无需更新分类器即可修复,仅对无法恢复的剩余事件进行微调。

## 引言  
已部署的 LLM 应用会将生成的每对“提示-响应”提交给安全分类器:提示(用户消息加注入上下文)和模型响应。我们将此流称为应用的 **流量**。分类器 **门控** 该流量:对于每对输入输出二元判决(安全或不安全),应用据此放行或拦截该对输入。此外,LLM 安全性尚无统一的形式化定义;实践中,安全由已部署分类器的标记所操作性定义。部署中存在两种失效模式:分类器的隐式策略在训练时固定,可能偏离部署者自身策略;其门控流量的分布随使用演变和对抗者适应而变化,导致判决性能下降(Piet et al. 2025)。我们通过在分类器外围添加单一轻量层解决这两个问题。当判决与部署者书面策略冲突时即为错误。由于自然语言策略无法形式化验证,我们估计每个判决错误的概率并纠正可能错误的判决。该正确性估计层引导现成分类器趋近部署者策略,同时提供无标签信号检测部署漂移。该信号驱动维护循环:在流量偏移时修复层,仅在必要时微调分类器。

实验首先检验设计假设:估计器必须基于分类器自身的判决进行条件化,因为“安全”判决仅可能因放行违规内容而错,“不安全”判决仅可能因拦截无害内容而错,因此单一聚合估计器服务于两者会导致性能下降。图1提供了概述。

图1:基于规则的正确性估计在部署时纠正现成分类器的决策,并产生无标签漂移信号。现成分类器门控每对“提示-响应”;此处其判决放行了部署者策略应拦截的内容。基于分类器内部状态的探测器估计判决何时错误,RCV 进行纠正(上部);这些估计的事件计数被无标签监控以观察漂移(下部)。

#### 问题表述  
考虑一个应用,令 **x** 为项目(“提示-响应”对)。部署者持有书面安全策略 **T**(自然语言形式),记 **Y = C(x)** 为现成分类器 **C** 的判决。策略通过神谕 **Y⋆(x)** 实现(通过人工标注或应用 **T** 的 LLM 裁判)。该方法与此选择无关:**Y⋆** 仅通过标注样本引入。神谕可离线获取,但作为在线流量的每项依赖不切实际。假设对 **C** 指定白盒访问权限:部署者可读取 **C** 的内部状态及每个判决(例如分类器自托管时)。指示器 **A = 1{Y = Y⋆}** 记录每个项目的一致性,而 **遵循度** 是 **A** 在流量分布上的期望。注意遵循度提升意味着与 **Y⋆** 一致性的提高,而非直接与 **T** 一致。流量分布非平稳,因此遵循度是时间的函数;部署者需设定底线。问题因此是双重的:在部署时提高遵循度,并在流量漂移时保持其高于底线。

#### 作为安全案例的遵循度  
工程意义上的安全案例是部署系统将避免不可接受结果的结构化论证,其有效性需在部署窗口内监控(Clymer et al. 2024)。此处维护的核心主张是遵循度保持在底线以上。该场景符合框架中的子系统示例:结合监控输出的分类器的生成模型。相关文献将分布偏移列为此类主张在部署中难以持续辩护的原因之一。在流量漂移时维持该主张是我们所解决问题的第二部分。

#### 现有杠杆与工具  
希望分类器遵循自身策略的部署者有几种手段,包括接受其隐式策略、微调(需要权重访问和 GPU,且有回归风险)以及堆叠过滤器(每个过滤器是具有自身策略的新模型)。监控已部署分类器的工具跟踪其他量:漂移监控器跟踪输入分布、分类器的分数或无标签准确度估计;学习的正确性估计器为每个预测的可靠性评分,使系统可在可靠性低时拒绝。RCV 的独特之处在于其对象:估计分类器在部署者策略下的自身判决正确性,并将此单一估计用于纠正和监控。相关工作给出完整定位。

本文贡献如下:  
- **基于规则的正确性**:发现分类器在部署者策略下的正确性可由其内部状态估计,且纠正时的估计必须基于分类器判决进行条件化:“安全”和“不安全”判决以不同方式失效,需要独立的估计器和校准。对于给定分数的两种不同错误结构,单一校准无效。  
- **估计器**:引入 RCV(基于规则的正确性估计器),在部署者策略的标注样本上训练,每个规则一个探测器和一个校准,基于分类器内部状态产生与该策略不一致的校准概率。部署时,每个规则仅需几千参数,无需额外语言模型。  
- **应用**:该估计器在单一共享信号上实现策略适应和部署维护:翻转规则纠正估计错误概率超过阈值的判决,从这些估计导出的事件计数被无标签监控以标记漂移。  
- **产出**:我们公开代码、神谕标签映射、每种子结果,以及从官方数据集重建两个评估集的脚本。

在部署研究中,我们将十个攻击活动注入由现成 Llama-Guard-3 门控的流量。专用注入面板在首次警报时以中位攻击率 **0.115**(100 次运行中 100 次)检测到所有活动。在部署的一百个漂移事件中(十个保留家族跨十个种子),审计修复在有限标签预算内恢复了 **79** 个事件的漂移前标准,当审计受数据限制时为 **87** 个;微调保留给修复无法恢复的剩余事件。在六种分类器-数据集组合中,遵循度均提升,捕获的之前未识别不安全内容比例范围为 **0.29** 至 **0.81**。

## 方法:基于规则条件的验证  
图2:纠正与维护是同一正确性估计器的应用。*面板A(推理):正确性估计与决策纠正。* **C** 输出判决 **Y** 并暴露状态 **Z**;判决将项目路由至两个校准探测器之一,翻转规则纠正估计错误的判决。*面板B(部署):漂移监控与维护。* 每个规则的事件计数基于正确性估计无标签监控;警报触发探测器更新,若更新未通过则触发 **C** 微调。

#### 正确性估计  
为何分类器的内部表征能揭示其判决是否与从未训练过的策略一致?我们考虑的每个分类器都是微调的大型语言模型,其表征受通用语料预训练塑造,并编码了安全专用部分未使用的更多输入信息。微调使决策专门化而非重建表征,因此即使分类器自身判决忽略这些特征,与不同策略相关的特征仍可能保留。基于这些表征和部署者策略示例的探测器可学习部署者对模型已计算特征的决策规则。探测器利用表征中已编码的潜在特征;它不恢复输入的新信息。探测器已知可恢复此类潜在属性,从冻结分类器的正确性(Corbière et al. 2019)到裁判判决的正确性(Radharapu et al. 2025)。这些系统在估计值低时拒绝;我们的系统纠正判决。由于两种错误方向以不同方式失效,一个校准必须对两者都有效。我们假设这是不可能的,且估计器必须基于分类器的判决进行条件化。

正确性估计层通过在分类器内部表征上部署探测器实现。“安全”判决仅可能因遗漏违规而错,“不安全”判决仅可能因过度拦截而错。判决因此划分错误:每个值定义一个规则,即方法命名的条件依据。RCV 为每个规则配备独立的探测器和校准映射。基于 **C** 暴露的内部表征 **Z**,探测器估计判决对部署者策略错误的概率。划分不增加推理时间成本;实验回答收益是否在有限数据分割给两个探测器时得以保留。附录 A.1 展示为何单一校准映射无法服务于错误率在给定分数时不同的两个规则。

#### 决策纠正  
当校准估计超过阈值 **τ**(默认 0.5)时,RCV 翻转判决。在安全规则中,翻转将放行转为拦截;在不安全规则中,将拦截转为放行(图2)。

#### 漂移监控  
相同探测器使部署系统无需标签即可观测。当探测器在当前流量上校准时,每个规则的项目平均估计是该规则错误率的插入式估计(附录 A.2)。两者共同决定遵循度:其流量加权平均是部署系统的错误率,遵循度为其补数。部署者承诺的底线是遵循度的底线。相同划分分离漂移的两个方向:使有害内容溜过分类器的漂移首先在安全规则中体现;使分类器过度拦截的漂移首先在不安全规则中体现(图3显示接受侧;拒绝侧在检测实验中使用)。相比之下,分类器自身的拦截率会遗漏溜过的有害内容,因为它以放行流量到达且不改变拦截计数。RCV 的漂移信号源自内部状态(通过训练的正确性估计读取),而非分类器的置信分数。因此漂移表现为探测器训练所估计内容(与部署者策略的一致性)的变化。部署时,每个规则由基于校准正确性分数嵌套事件计数的独立序列测试监控;该测试在超过基于无漂移流量估计的参考率持续增加时报警(机制与参数见附录 D)。测试阈值在校准至预设误报容忍度的无漂移流上校准,实际误报率在同一类流量上测量。

#### 维护  
当警报触发时,记录流量混合,并据此合成所有后续审计和门控材料。审计未在训练或校准中使用的项目;每个标注项目被分配至更新训练集或校准集。然后在同样混合且未用于拟合的保留块上评估探测器候选更新。当候选更新保持漂移前标准(召回率和过度拦截均在预设容差内)时接受。若无候选通过,审计在固定预算内扩大;预算耗尽时,循环终止并升级为微调分类器(自动化循环外的指定最后手段,也是唯一改变表征本身而非其读取方式的操作)。接受修复后,参考混合以警报触发的速率更新注入家族,并在从更新参考混合抽取的预热段上重新校准监控器;**C** 不变。微调后,探测器在新表征上重新拟合,**C** 权重再次固定,并进行重新武装读取。用漂移文献术语,该循环是门控的、纠正耦合的概念漂移适应实例(Gama et al. 2014)。

图3:所有十个保留攻击活动在 **0.30** 攻击率上限前报警,中位攻击率 **0.115**(家族中位数 **0.063–0.158**),针对 Llama-Guard-3。每个标记是十个种子之一,置于计划攻击率位置及监控器首次警报处。黑色刻度线为家族中位数。

## 实验  
图4:跨三个探测器家族的路由消融:每个单元中基于规则的路由优于其聚合对应物。PKU-SafeRLHF 上路由与聚合正确性探测器 AUROC(按分类器),针对线性探测器(部署选择)、小型多层感知机和梯度提升树。标记为十种子均值(种子间标准差 **0.003–0.009**)。

#### 设置  
我们评估

相似文章

学习高覆盖判别性简约规则集

arXiv cs.LG

本文介绍了CDPR,一种基于子模最大化学习高准确率且可解释分类规则集的新方法,与现有方法相比,覆盖率提升超过2.5倍。