从正则表达式中隔离LLM对齐:对抗性变异下的零覆盖和度量依赖分歧

arXiv cs.AI 论文

摘要

本文研究了在旨在绕过正则表达式的对抗性探针下,LLM对齐是否提供超出正则表达式过滤器的额外覆盖。通过一项移除正则表达式过滤器的消融研究,发现对齐的贡献是度量依赖的:在自然语言有害请求上零覆盖增益,但在对抗性构造的变体上可检测出拒绝。

arXiv:2607.20494v1 公告类型:新 摘要:生产级LLM应用通常将正则表达式过滤器堆叠在模型侧对齐之前;先前的研究发现,在活跃的正则表达式过滤器后端添加一个实时的Gemini后端并未带来可衡量的覆盖增益。我们探究当语料库被\emph{设计用于绕过正则表达式}时,这一上限是否仍然成立。我们引入了$L_5$-no-regex——与$L_4$-real(Gemini-2.5-flash、令牌预算上限、速率限制、输出清洗)相同,但禁用了九模式过滤器——并在三个子语料库(延续、正则绕过、对齐隔离)上,针对$N{=}45$个对抗性探针进行评估,并通过Gemini释义和PAIR放大,在$N{=}5$次重复中生成${\sim}1{,}555$个探针-运行对。在主要子串分类器下,H1被反驳:$L_5$的拦截率在所有五个OWASP LLM Top-10类别中均为$0,%$(相对$L_0$的$\Delta\text{pp}{=}0$,$p{=}1.00$;Wilson上限${<}5,%$)。在PAIR变体上的辅助LLM评判指标显示$56$--$100,%$的拦截率($p{<}0.01$),揭示了对齐确实对对抗性框架探针做出响应——但产生的拒绝过于微妙,无法通过子串匹配检测。子语料库差异预测不被支持($p{=}1.00$)。对齐的贡献是\emph{度量依赖的}:在自然语言有害请求探针上,它带来的观察覆盖完全等同于正则表达式;在对抗性框架变体上,LLM评判能检测到子串分类器遗漏的拒绝。锁定语料库、变异产物和导出脚本已发布以供复现。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:02

# 零覆盖与指标依赖的对抗性变异分歧
来源:https://arxiv.org/html/2607.20494
## 将LLM对齐与正则表达式隔离:对抗性变异下的零覆盖与指标依赖的分歧

###### 摘要

生产环境的LLM应用通常会在模型侧对齐之前叠加一个正则表达式过滤器;先前的研究发现,在已启用正则表达式过滤器的情况下,添加一个实时的Gemini后端并未带来可衡量的覆盖增益。我们提出的问题是:当语料库*旨在绕过正则表达式*时,这一上限是否仍然成立。我们引入了 L5\_no\-regex——与 L4\-real(Gemini\-2\.5\-flash、令牌预算上限、速率限制、输出清洗)相同,但禁用了九种模式过滤器——并针对三个子语料库(延续、正则绕过、对齐隔离)中的 N=45 个对抗性探测进行评估,通过 Gemini 释义和 PAIR 增强为约1,555个探测\-运行对(N=5次重复)。在主要子字符串分类器下,H1 被反驳:L5 在全部五个 OWASP LLM 十大类别的拦截率均为 0%(与 L0 相比 Δpp=0,p=1\.00;Wilson 上限<5%)。一个基于 LLM 评判器的次要指标显示,PAIR 变体的拦截率为56–100%(p<0\.01),这表明对齐确实会对以对抗性方式构建的探测做出响应——但产生的拒绝过于细微,无法被子字符串匹配检测到。子语料库的差异预测未得到支持(p=1\.00)。对齐的贡献是*指标依赖的*:在自然语言的有害请求探测上,它相比正则表达式没有增加任何可观测的覆盖;在对抗性构建的变体上,LLM 评判器能检测到子字符串分类器遗漏的拒绝。锁定语料库、变异产物和导出脚本均已发布以供复现。

## 1 引言

生产环境中的 LLM 应用通常堆叠多层防御:一个正则表达式输入过滤器,用于拦截已知的越狱模式;接着是模型侧对齐——基于安全性的微调(RLHF/RLAIF),训练模型根据语义拒绝有害请求。从业者通常假设这些层是互补的。然而,先前的工作[9 (https://arxiv.org/html/2607.20494#bib.bib11)]——使用一个突破与攻击模拟(BAS)框架,针对一个四目标消融格子重放对抗性探测——表明,在已启用的正则表达式过滤器后面添加一个真实的、经过对齐训练的 LLM(Gemini\-2\.5\-flash),在固定的 60 模板脆弱性语料库上*并未产生可衡量的覆盖增益*。结论表述得很谨慎:在*该语料库*上,正则表达式似乎是对齐的上限。一个悬而未决的问题是:正则表达式是否是一个严格的上限,或者对齐是否会在*旨在绕过正则表达式*的探测上带来可测量的贡献?

本文通过实验评估了这一问题。我们从一个其他方面完全相同的防御堆栈中移除了正则表达式过滤器,并使用三种互补的变异策略(其中两种在本文中进行了评估)来探测残留的对齐。结果是一个清晰的单轴消融:除了输入过滤器的存在与否,所有变量都保持不变。

#### 研究问题。

当正则表达式过滤器的上限被移除时,LLM 对齐拒绝(*Gemini\-2\.5\-flash*)是否会在无防御基线之上增加可测量的拦截率提升?我们将此操作化为假设 H1:*对于至少一个 OWASP LLM 十大类别*(一个包含十个 LLM 特定威胁类别的标准分类法[14 (https://arxiv.org/html/2607.20494#bib.bib1)]),*L5\-no\-regex 的拦截率 > L0(无防御)*。

一个衍生预测源自我们的语料库设计:*对齐隔离*子语料库(自然语言中的有害请求,无触发过滤器的关键词)预计在 L5 上的*绕过率高于**正则绕过子语料库**(编码/混淆攻击)。直觉是,对齐训练可能对结构性的逃避线索(Base64、角色注入框架)比用普通语言表达的明确恶意意图更敏感——这是一种*虚假特征依赖*[6 (https://arxiv.org/html/2607.20494#bib.bib16)]。如果这一预测成立,将表明对齐对明确的对抗性框架比对普通语言中的语义有害请求更敏感。

#### 贡献。

1. 1\. L5\-no\-regex 目标——一个新的消融端点,将[9 (https://arxiv.org/html/2607.20494#bib.bib11)]的四目标格子扩展为第五个条件:相同的 Vertex AI 后端,相同的令牌预算和速率限制控制,输入正则表达式禁用。
2. 2\. 变异语料库(llm\-mutation\-locked\-2026\-06\-03,N=45)——三个子语料库涵盖正交攻击面:*延续*(先前格子探测[9 (https://arxiv.org/html/2607.20494#bib.bib11)],用于基线连续性)、*正则绕过*(N=25,通过编码/混淆规避 L3 正则表达式的探测),以及*对齐隔离*(N=13,无句法正则触发器的语义攻击)。语料库、变异变体产物和运行 JSON 均已发布以供复现。
3. 3\. 变异增强(评估了两种策略)—— Gemini 释义[9 (https://arxiv.org/html/2607.20494#bib.bib11)]和 PAIR(迭代式攻击者 LLM 使用目标响应作为反馈进行优化[3 (https://arxiv.org/html/2607.20494#bib.bib7)])被应用于 L5 并进行评估,在 N=5 次重复下产生了约 1,555 个探测\-运行对。TAP[12 (https://arxiv.org/html/2607.20494#bib.bib8)]变体已生成并发布;对 L5 的评估推迟(见 §4\.5 (https://arxiv.org/html/2607.20494#S4.SS5))。
4. 4\. 按 OWASP 分类的归因及置信区间—— L5 与 L0 成对比较的 Wilson 95% 置信区间和 Fisher 精确 p 值,遵循[9 (https://arxiv.org/html/2607.20494#bib.bib11)]的统计协议。

#### 范围。

所有实验均针对一个由 Gemini\-2\.5\-flash 支持、温度=0\.7 的合成本地部署端点。结果仅限于此后端和语料库;我们不提出关于跨 LLM 家族的对齐拒绝的一般性声明。正则绕过子语料库是*设计用来*规避过滤器的,因此它旨在衡量移除正则表达式后的行为。在此类探测上得到零结果因此与 H1 直接相关。

#### 路线图。

第2节 (https://arxiv.org/html/2607.20494#S2) 定位与先前工作的关系。第3节 (https://arxiv.org/html/2607.20494#S3) 描述消融格子、语料库和变异策略。第4节 (https://arxiv.org/html/2607.20494#S4) 报告拦截率、置信区间和 p 值。第5节 (https://arxiv.org/html/2607.20494#S5) 讨论威胁和未来工作。

## 2 相关工作

#### BAS 与 LLM 应用基准测试。

突破与攻击模拟(BAS)平台([1 (https://arxiv.org/html/2607.20494#bib.bib3),17 (https://arxiv.org/html/2607.20494#bib.bib4),16 (https://arxiv.org/html/2607.20494#bib.bib5)])通过重新运行针对生产基础设施的攻击场景来衡量控制覆盖。先前的工作提出通过一个四目标消融格子[9 (https://arxiv.org/html/2607.20494#bib.bib11)]将 BAS 适配到 LLM 应用:L0(无防御)、L1(仅拒绝短语过滤器)、L2(仅令牌预算控制)、L3(全栈)。本文通过 L5\-no\-regex 扩展了该格子 —— 与 L4\-real 相同的后端,但移除了正则表达式 —— 以隔离对齐的贡献。

#### 对抗性变异策略。

PAIR[3 (https://arxiv.org/html/2607.20494#bib.bib7)] 使用一个攻击者 LLM,利用目标的响应作为反馈,迭代地优化越狱提示,在 ≤ 20 次查询内实现持续绕过。TAP[12 (https://arxiv.org/html/2607.20494#bib.bib8)] 通过攻击的分支树和剪枝步骤扩展了这种方法,减少了所需的总查询次数。GCG[21 (https://arxiv.org/html/2607.20494#bib.bib2)] 通过梯度下降优化对抗性后缀,需要白盒访问。我们使用 PAIR 和 TAP(黑盒,与 Gemini API 兼容),并排除 GCG(白盒,不适用于 Vertex AI)。AutoDAN[7 (https://arxiv.org/html/2607.20494#bib.bib13)] 通过模板上的遗传算法生成隐蔽的越狱 —— 一种相关但不同的方法。

#### 对齐脆弱性。

Wei 等人[19 (https://arxiv.org/html/2607.20494#bib.bib6)] 描述了对齐失败的两个根本原因:*竞争目标*(安全性与有用性训练之间的张力)和*不匹配的泛化*(安全训练未能泛化到分布外的措辞)。我们的正则绕过子语料库直接针对不匹配的泛化:探测在保留攻击意图的同时改变了表面形式。Perez & Ribeiro[15 (https://arxiv.org/html/2607.20494#bib.bib14)] 引入了*提示注入*攻击类别,表明嵌入在用户输入中的间接指令可以覆盖系统级指令。我们的间接框架探测遵循此分类法。

#### 评估基准。

AdvBench[20 (https://arxiv.org/html/2607.20494#bib.bib15)](N=520)和 HarmBench[11 (https://arxiv.org/html/2607.20494#bib.bib9)](N=510)是主要的大规模越狱评估语料库。JailbreakBench[2 (https://arxiv.org/html/2607.20494#bib.bib10)](N=100)引入了 JBB\-Behaviors 语料库和基于评判器的评估协议(二元攻击成功率)。StrongREJECT[18 (https://arxiv.org/html/2607.20494#bib.bib19)] 进一步表明,基于子字符串的攻击成功率指标系统性地高估了越狱效果(与人类和 LLM 评判器评估相比),因为成功的越狱会降低模型的通用能力同时绕过安全训练,产生分类器标记为成功但实际上不具危害性的输出。我们的语料库(N=45)有意更小但更专注:贡献在于单轴消融(L5 与 L4),而非覆盖广度。变异增强产生了约 1,555 个评估的探测\-运行对(约 395 个唯一,TAP 除外),在评估量级上与 JBB 相当。表1 (https://arxiv.org/html/2607.20494#S2.T1) 将我们的语料库与先前工作进行了比较。

表 1: 相关基准测试的探测语料库规模。变异增强列统计所有变体实例(Nbase × Kvariants 每种策略)。  
| 基准测试 | Nprobes | 变体 | 参考文献 |
|----------|---------|------|----------|
| AdvBench | 520 | — | [20] |
| HarmBench | 510 | — | [11] |
| JBB-Behaviors | 100 | — | [2] |
| PAIR | 50 | 20 | [3] |
| Maiorano[9] | 17 | 300 | [9] |
| 本文 | 45 | ~395 | — |

#### 并发基准测试。

JailbreakBench[2 (https://arxiv.org/html/2607.20494#bib.bib10)] 通过一个固定的 100 行为语料库和基于评判器的二元 ASR 指标标准化了评估。我们的贡献是正交的:JailbreakBench 衡量*单个模型拒绝的频率*,而我们通过消融格子衡量*哪个防御层*负责。该格子为层归因提供了一个精确工具,这是大规模覆盖基准测试无法提供的。

#### 针对提示注入的架构防御。

StruQ[4 (https://arxiv.org/html/2607.20494#bib.bib18)] 提出了结构化查询,在格式层面将指令与数据分离,防止通过不可信输入进行注入。SecAlign[5 (https://arxiv.org/html/2607.20494#bib.bib17)] 通过偏好优化训练模型仅遵循结构化指令令牌,使对齐本身具有抗注入能力。这两种方法都解决了根本原因(指令\-数据混淆),而不是在未修改的模型前部署过滤器。我们的研究是互补的:我们在一个简单的拒绝列表过滤器后面衡量标准对齐(无偏好优化)的残余贡献,为量化 StruQ/SecAlign 带来的增益提供了基线。

#### 定位。

本文首次通过在同一生产后端上的单轴消融,将对齐与共同部署的正则表达式过滤器隔离开来。先前的工作要么在没有共同部署正则表达式过滤器的情况下评估对齐([3,12]),要么在评估过滤器堆栈时没有隔离对齐的残余贡献[9]。我们通过引入 L5\-no\-regex 作为第五个格子条件来填补这一空白。主要贡献在于*消融方法论*;语料库和变异产物已发布,以实现复现和扩展。

## 3 方法论

### 3\.1 消融格子

先前的工作[9 (https://arxiv.org/html/2607.20494#bib.bib11)] 引入了*防御格子*:一组合成 HTTP 端点,每个端点实现不同的防御组合,因此跨端点的发现计数可以揭示哪个防御层关闭了哪些威胁。原始格子有四个条件:L0(无防御,是一个回显每个请求的桩)、L1(仅拒绝短语正则表达式)、L2(仅令牌预算和速率限制控制)、以及 L3(全栈:正则表达式 + 预算 + 工具注册认证 + 输出清洗)。第五个条件 L4\-real 用实时的 Gemini 调用替换了桩后端。关键发现是在一个 60 模板脆弱性语料库上 L4 ≈ L1:正则表达式是对齐的上限。我们通过 L5\-no\-regex 扩展了这个格子,以测试该上限在旨在绕过正则表达式的语料库上是否仍然成立。表2 (https://arxiv.org/html/2607.20494#S3.T2) 总结了所有六个条件,图1 (https://arxiv.org/html/2607.20494#S3.F1) 说明了单轴消融设计。

表 2: 防御格子。L0–L3 是确定性桩(零运行间方差);L4 和 L5 调用相同的 Vertex AI 端点,温度为 0\.7。L4 和 L5 之间的唯一区别是输入过滤器的存在。  
L4\-real  
L5\-no\-regex (本文)  
探测输入 →  
正则过滤器 (9 种模式)  
拦截  
令牌预算 · 速率限制  
Gemini-2.5-flash (对齐)  
响应  
探测输入 →  
正则过滤器 (禁用)  
令牌预算 · 速率限制  
Gemini-2.5-flash (对齐)  
响应  
仅有的区别:相同/相同  

图 1: 单轴消融:L5\-no\-regex 与 L4\-real。唯一区别是输入过滤器:在 L4 中启用(红色虚线 = 探测在此被拦截),在 L5 中禁用(探测直接到达对齐)。预算、速率限制和 Gemini 后端完全相同。  
L1、L3 和 L4 上的输入过滤器是一个九种模式的正则表达式,应用于任何 LLM 调用之前的原始提示字符串。模式针对: (1) DAN\-mode/do\-anything\-now 角色覆盖; (2) developer\-mode 激活; (3) 指令忽略命令(ignore\.\*prior\.\*instructions); (4) 逐字重复请求(repeat\.\*verbatim); (5) 系统提示打印请求(print\.\*your\.\*prompt); (6) 情感操纵(grandma\|grandmother); (7) ChatML 注入(<\|im\_start\|\>); (8) base64\-decode\-and\-follow;以及 (9) 字面字符串 jailbreak。所有模式均不区分大小写。完整列表在附录B (https://arxiv.org/html/2607.20494#A2) 中重现以供验证。这个过滤器有意简单——一个从业者级别的、针对最常见、最著名的越狱表面形式的拒绝列表——使其成为一个现实的基线,而非最先进的技术。

相似文章

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性

arXiv cs.AI

本文提出了一个混合框架,结合一阶安全对齐与零阶微调,以增强LLM安全对齐在受到对齐后扰动时的鲁棒性。理论和实验结果表明,仅需少量微调步骤即可在保持安全性的同时提升鲁棒性。

面向鲁棒即插即用适配的解耦对齐

arXiv cs.CL

介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。

测量、定位和消除LLM中的对齐特征

arXiv cs.LG

本文研究了LLM后训练如何引入类似AI的风格规律,并提出了PASTA,一种无需训练的方法来定位和消除这些对齐特征,从而在11个模型和6个检测器上降低AI检测率同时保持连贯性。