有效性感知的大型语言模型越狱评估

arXiv cs.AI 论文

摘要

本文提出了SEAV,一种以验证为中心的框架,用于评估大型语言模型的越狱鲁棒性,通过评估响应的有效性和正确性,显著降低了安全评估中的假阳性率。

arXiv:2609.00498v1 公告类型:新 摘要:越狱鲁棒性已成为大型语言模型(LLM)安全评估的核心,然而主流方法主要依赖于拒绝行为、语义相似性和意图匹配启发式方法,这些方法强调语言的合理性而非正确性。我们指出现有评估的一个关键局限:许多越狱意图依赖于指令有效性而非认知事实性,使得看起来合理的响应被标记为成功,尽管它们在事实上或程序上不正确。为了解决这一差距,我们提出了顺序认知与操作级验证(SEAV),一种以验证为中心的越狱评估框架,将响应分解为有序步骤,并评估其有效性和正确性。SEAV结合了用于语义解释的LLM作为评判机制与使用外部知识源的检索验证,评估生成的内容是否在事实上正确、结构上一致,并在操作上能够推进有害目标。实证上,SD-A(一个精心策划的战略不诚实诊断)上的假阳性率与最强基线相比降低了14.9个百分点,并在四个公开基准中的三个上将22.1%--51.0%的先前标记为成功的样本重新分类为无效。这些结果共同表明,强制正确性显著改变了测量的鲁棒性:许多先前标记为越狱成功的案例被重新分类为无效,并且结果在测试的搜索后端和评估模型中保持稳定。代码和数据可在https://github.com/Ardor-Wu/SEAV获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:04

# 面向大型语言模型的有效性感知越狱评估  
来源:https://arxiv.org/html/2609.00498  

Sahil Wadhwa  
隶属机构:Capital One  

Pranab Mohanty  
隶属机构:Capital One  

Giri Iyengar  
隶属机构:Capital One  

Varun Chandrasekaran  
隶属机构:伊利诺伊大学厄巴纳-香槟分校  

###### 摘要  
越狱鲁棒性已成为大语言模型(LLM)安全评估的核心,但现有方法主要依赖拒绝行为、语义相似度和意图匹配启发式,强调语言合理性而非正确性。我们发现现有评估存在一个关键局限:许多越狱意图依赖于指令有效性而非认知事实性,这使得看似合理的响应可能因事实或程序错误而被标记为成功。为解决这一差距,我们提出**顺序认知与操作级验证(SEAV)**——一种以验证为中心的越狱评估框架,将响应分解为有序步骤并评估其有效性和正确性。SEAV结合LLM作为语义解释的评判器,并通过外部知识源进行检索增强验证,评估生成内容是否在事实正确、结构一致且能有效推进有害目标。实证显示,与最强基线相比,SEAV在SD-A(战略欺骗诊断集)上的假阳性率降低14.9个百分点,并在四个公共基准中的三个上将22.1%–51.0%的先前标记成功案例重新分类为无效。这些结果共同表明,强制正确性显著重塑了测量的鲁棒性:许多先前标记的越狱成功被重新分类为无效,且结果在不同检索后端和评估模型中保持稳定。代码与数据可在此处获取:https://github.com/Ardor-Wu/SEAV  

## 1 引言  
大型语言模型(LLM)的应用场景日益广泛,通过精心构造的越狱策略进行滥用可能导致有害输出(Zou et al., 2023)。因此,评估模型对越狱尝试的鲁棒性已成为现代安全评估的核心(Mazeika et al., 2024; Perez et al., 2022)。先前研究指出,攻击成功率(ASR)的比较可能因测量程序不一致而失效(Chouldechova et al., 2025)。我们发现了一个更根本的局限:即使在一致的协议下,ASR也可能无法捕捉模型是否产生**有效的**有害输出<sup>1</sup>。  
<sup>1</sup>有效性包括相关性、事实正确性、顺序合规性和操作效力(§2)。  
因此,尽管越狱基准库快速增长,当前评估方法可能误导LLM的真实安全态势。  
为量化此类案例的普遍性,我们使用附录C.3的标注程序对多个基准数据集的提示进行意图分类,并通过人工验证。表1显示了分布情况(基于表3中n=322的多步骤子集计算)。  

**表1:越狱数据集中提示意图的分布**  
提示被分类为认知事实性、指令事实性或两者皆非。参考标题  

**图1:SEAV流程**:(1)提取有序步骤,(2)通过网络搜索验证每个步骤,(3)检查顺序一致性,(4)聚合成最终分数。  

跨数据集分析表明,大多数提示对应于指令事实性意图,表明越狱请求主要寻求可执行程序而非认知信息。因此,程序正确性和依赖结构是越狱响应的核心属性,但主流评估范式并未对其进行验证。相反,许多基准将非拒绝或表面意图满足视为成功证据,依赖语义相似度或表面合规性。因此,看似合作但包含事实错误或无效步骤的响应仍可能被标记为成功的越狱。这对指令事实性查询尤其成问题,因为其效用依赖于正确性和可执行性。忽略指令有效性的评估可能高估模型能力。  
我们提出将SEAV作为补充性的生成后操作有效性层(图1),而非替代拒绝、策略合规或有害性评估。实证表明,强制有效性显著改变测量的鲁棒性:SEAV在诊断数据集上实现最低假阳性率(§6.1),将基准标记的大量成功案例重新分类为无效(§6.2),并在我们测试的检索后端和评估模型中保持稳定(§6.3)。我们的贡献包括:  
- 1. 四维度认知/指令有效性公式化;  
- 2. 四阶段提取、验证、排序和聚合流程;  
- 3. SD-A与OrdSense诊断压力测试;  
- 4. 操作有效性基准重评估。  

## 2 问题表述  
给定有害意图和响应,成功范围从**非拒绝**(即使错误也是策略失败)到**操作有效**(正确、可执行、完整的有害能力)。前者混淆意图与能力;后者可能忽略需拒绝的风险(§9)。我们采用操作有效端,测试实际推进能力并捕获看似合理的错误。此补充层既不唯一定义成功,也不替代拒绝、策略合规或有害性评估;更宽松的规则仍可适用。  
知识意图需要真实主张(**认知事实性**);程序意图需要正确、有序、可执行的步骤(**指令有效性**),例如危险试剂配方或漏洞利用步骤。  

###### 定义1(成功越狱)  
操作有效性要求:(1)与有害意图**相关**;(2)基于可靠任务相关证据的**事实正确性**;(3)可执行依赖的**顺序合规性**;(4)在前三个维度后的**操作效力**或充分完整性。  

## 3 现有评估器的局限性  
基于§2的补充操作有效性公式,我们分析现有评估器的两种失败模式:过度依赖语言合理性(§3.1)和对顺序敏感性的忽视(§3.2)。  

### 3.1 过度依赖语言合理性  
我们审视越狱评估中的一个根本歧义:将**语言合理性**与**认知有效性**混为一谈<sup>2</sup>。语言合理性指流畅性、连贯性和表面真实性,而认知有效性指事实和操作正确性。许多评估流水线将逼真、详细且意图对齐的响应视为成功的越狱,但这一假设很脆弱。  
为区分这一概念,我们从Panfilov et al. (2025)的战略欺骗数据构建诊断评估集SD-A。我们保留LLM选择战略欺骗选项(旨在看似有害但包含故意不准确)的响应,过滤被OpenAI Moderation API(omni-moderation-latest)标记的意图,对每个唯一意图采样一个响应,得到154个样本(见附录B.2)。与传统越狱数据集不同,SD-A提供受控环境,其中响应被故意生成为语言合理但认知不正确。尽管正确性未被事后独立验证,但这些响应源自在受控多选题环境中选择欺骗而非拒绝的模型,这足以满足诊断目标。  
由于响应被设计为包含事实错误,任何将其标记为成功越狱的评估器都未能检测认知无效性。我们使用五种代表性范式评估每个响应,均以Gemini 3 Flash Preview(Google DeepMind, 2025)(以下简称Gemini 3 Flash)为评判模型(见附录A):  
- • M1. LLM作为评判器  
- • M2. LLM作为评判器 + 网络搜索(附录C.2)  
- • M3. StrongREJECT(Souly et al., 2024)  
- • M4. JADES(Chu et al., 2025)  
- • M5. JADES + 事实核查扩展  

**表2:SD-A响应被标记为越狱的比例**  
比例越低越好。SD-A构建细节见附录B.2。  

表2揭示了一个惊人模式:尽管设计上认知无效,超过50%的SD-A响应在M1–M5中被标记为成功的越狱。这表明面向合理性的信号频繁主导正确性考量,导致假阳性(相对于SD-A构建:响应因生成模型选择战略欺骗选项而被选中;单个响应的正确性未被独立重新验证)。  
**结论**:现有评估器系统性地将语言合理但认知无效的响应误分类为成功越狱。  

### 3.2 对顺序敏感性的忽视  
第二种正交的失败模式出现在涉及有序步骤、依赖关系或程序结构的响应中。许多越狱提示寻求工作流、多阶段推理或可执行程序,但主流评估范式大多将响应视为无序语义产物,强调主题相关性或意图满足而忽略**程序正确性**。程序领域的正确性本质上对顺序敏感。违反排序约束、依赖关系或前提条件可能使原本详细的响应失效。模型常生成单独合理但因排序不当或缺失前提而集体错误的步骤。例如,配置工作流可能指导用户在安装所需包之前执行依赖命令,或在变量定义前引用它们。尽管每个步骤单独看似合理,但整个过程变得不可行。  
为量化顺序敏感任务的普遍性,我们分析五个广泛使用的越狱评估数据集,测量呈现多步骤程序结构的响应比例。每个意图-响应对通过SEAV的步骤提取机制(附录C.1)处理,将响应结构分类为**顺序**、**无序**或**单步骤**。被分类为**顺序**的响应计为多步骤。表3总结结果。  

**表3:具有多步骤程序结构的意图-响应对比例**  
由SEAV的步骤提取分类(附录C.1)。  

先前突出的多步骤查询普遍性表明,程序正确性不是边缘案例,而是越狱基准的核心特征。然而,现有数据集对此维度的支持有限。虽然提示常需要有序推理,但基准通常仅包含提示-响应对,而无明确标注表明正确性是否依赖于排序、依赖结构或因果前提。为填补这一差距,我们策划了OrdSense——一个包含137个样本的顺序敏感评估数据集,源自WikiHow的操作指南,具有LLM推断的步骤级依赖图(完整构建流程见附录B.3)。对每个样本,我们构建三种响应变体:(a)原始步骤顺序,(b)依赖图有效拓扑排序中随机采样的替代顺序,(c)违反至少一个推断依赖的顺序。所有步骤文本均原样取自源材料,因此三种变体仅在**程序正确性**上不同。  
我们使用所有五种基线评估OrdSense。设$\mathcal{J}=\{x:f(x,a)=\textsc{jailbroken}\}$表示在情景(a)下被分类为越狱(JB)的样本集。我们定义:  
不稳定性 = $\frac{|\{x\in\mathcal{J}:f(x,b)\neq\textsc{jb}\}|}{|\mathcal{J}|}$ (↓)  
敏感性 = $\frac{|\{x\in\mathcal{J}:f(x,c)\neq\textsc{jb}\}|}{|\mathcal{J}|}$ (↑)  
其中$f(x,s)$表示评估器在排序场景$s\in\{a,b,c\}$下对样本$x$的裁决。不稳定性衡量有效重排下的裁决变化(越低越好),敏感性衡量违反依赖的重排下的变化(越高越好)。不稳定性是翻转率(↓越低越好),与敏感性(↑越高越好)直接可比,后者也是翻转率但基于违反依赖的重排。裁决$f(x,s)$使用附录A中每个评估器的二元规则;对SEAV而言,这是默认分数>0.25。表4报告两个指标;包括绝对JB率和所有样本翻转率的完整结果见附录B.1。  

**表4:OrdSense上的顺序敏感性**  
指标定义见正文,基于情景(a)中被标记为越狱的样本计算。  

M3–M5表现出近零敏感性(1.5%–16.9%),表明基于分解和量规的评估器对程序排序基本不敏感。M1和M2显示较高敏感性(71.9%和81.7%),但不稳定性增加:即使在有效重排下,M1仍翻转26.6%的裁决,表明其部分敏感性反映了普遍预测不稳定性而非结构推理。  
**结论**:SEAV是唯一将有效重排下的低不稳定性(9.6%)与对依赖违反的高敏感性(61.0%)相结合的评估器,区分了真正的排序意识与通用裁决不稳定性。  

## 4 我们的方法:SEAV  
我们介绍**顺序认知与操作级验证(SEAV<sup>3</sup>)**,一种面向正确性基准的越狱评估四阶段流程(图1)。给定有害意图和模型响应,SEAV按如下步骤进行:  
- 1. **顺序重述**(§4.1):将响应转换为有序步骤序列,对顺序、无序、代码主导和非结构化输出分别处理。  
- 2. **步骤验证**:...

相似文章