大语言模型红队测试框架:以忠实性评估为例

arXiv cs.CL 论文

摘要

本文提出了一种针对大语言模型的红队测试框架,采用多角色架构系统性地揭示模型漏洞,尤其在忠实性方面。该框架在问答任务中实现了攻击成功率提升7.9%,并强调了架构选择对模型安全性的影响超过参数规模。

arXiv:2606.25476v1 Announce Type: new 摘要:大语言模型在自然语言处理任务中展现了卓越性能,但其在高风险应用中的部署引发了关于可靠性、安全性和可信度的关键担忧。本文提出一种红队测试框架,系统性地揭示大语言模型输出中的漏洞。我们的方法采用新颖的多角色架构,包括目标模型、攻击者模型和陪审团模型。攻击者生成越来越有效的对抗性提示,而陪审团则严格评估回答的准确性和任务间一致性。在案例研究中,该策略在暴露大语言模型回答的不忠实性方面尤为有效。利用对抗性提示,问答任务中的攻击成功率最高提升了7.9%,揭示了可靠性缺陷。该方法识别出摘要任务中的结构约束如何塑造漏洞模式——格式限制在忠实性方面带来了可衡量的提升,并表明架构设计选择通常比参数规模更能决定模型安全性。该框架的关键优势在于其跨评估任务(从英文问答到阿拉伯语摘要)的适应性,能够全面比较模型漏洞。尽管它在比较跨模型和跨语言漏洞方面表现出色,但在完全自动化跨语言对抗性提示生成方面仍面临挑战。我们的实验还揭示了检测不忠实性的微妙形式(不表现为明显事实矛盾)时的局限性,尤其在跨语言语境中。总体而言,该架构既提供了对当前大语言模型漏洞的可操作见解,也提供了一种可扩展的方法论,用于随着模型演进进行持续安全评估。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:12

# 大型语言模型红队测试框架:基于忠实度评估的案例研究

来源:https://arxiv.org/html/2606.25476

\[1,3\]\\fnmMoataz\\surAhmed 1\]\\orgdiv信息与计算机科学系,\\orgname法赫德国王石油矿产大学,\\orgaddress\\city达兰,\\postcode31261,\\country沙特阿拉伯 2\]\\orgdiv计算机科学与信息技术学院,\\orgname伊玛目阿卜杜勒拉赫曼·本·费萨尔大学,\\orgaddress\\city达曼,\\postcode31441,\\country沙特阿拉伯 3\]\\orgdivSDAIA\-KFUPM人工智能联合研究中心,\\orgname法赫德国王石油矿产大学,\\orgaddress\\city达兰,\\postcode31261,\\country沙特阿拉伯

###### 摘要

大型语言模型(LLM)在广泛的自然语言处理任务中表现出色,但其在高风险场景中的部署引发了关于可靠性、安全性和响应可信度的严重担忧。本文提出了一种红队测试框架,能够系统性地揭示LLM输出中的脆弱性。我们的方法采用了一种新颖的多角色架构,包括目标模型、攻击者模型和陪审团模型。攻击者生成越来越有效的对抗性提示,而陪审团则严格评估任务中响应的准确性和一致性。在案例研究中,我们的红队策略在揭示LLM响应不忠实方面尤为有效。利用对抗性提示后,问答任务中的攻击成功率提升了高达7.9%,暴露了LLM可靠性的脆弱性。该方法成功识别了摘要任务中的结构约束如何显著影响脆弱性模式,其中格式限制显示出模型忠实度的可测量提升。研究表明,在决定模型安全性方面,架构设计选择通常比参数规模更重要。该框架的关键优势在于其跨不同评估任务(从英文问答到阿拉伯语摘要)的适应性,能够全面比较模型脆弱性。虽然我们的方法在跨模型和跨语言脆弱性比较方面表现出色,但在不同语言中完全自动化生成有效对抗性提示方面仍面临挑战。此外,我们的实验还揭示了在检测某些不表现为显式事实矛盾的不忠实形式时的局限性,特别是在跨语言环境中工作时。总体而言,这种红队架构既提供了对当前LLM脆弱性的可操作见解,也提供了一种随着模型发展可扩展的持续安全评估方法论。

###### 关键词: 大型语言模型,红队评估,忠实度评估,跨语言测试,自动化安全测试

## 1 引言

大型语言模型(LLM)通过基于Transformer的架构在大量文本语料上训练,改变了自然语言处理(NLP)领域,在各项任务中实现了前所未有的性能\[achiam2023gpt,bi2024deepseek\]。GPT-4和DeepSeek等模型日益集成到现实应用中,覆盖医疗、金融和法律服务等领域。然而,它们的大规模部署带来了安全、可靠性和稳健性方面的重大挑战\[Wei2023\]。为应对这些挑战,红队测试已成为识别LLM脆弱性的关键实践。红队测试最初源于军事模拟和网络安全,在此上下文中指通过精心构造输入来驱使系统生成有害、有偏见或其他不良输出的对抗性测试\[Perez2022\]。该过程既包括利用创造性“越狱”提示的人类专家,也包括生成大规模测试用例进行系统性探测的自动化系统\[derczynski2024garak\]。通过暴露潜在脆弱性,红队测试使组织能够在模型广泛部署前增强其韧性。

在与LLM脆弱性相关的多重风险中——包括有害内容生成\[Ganguli2022\]、敏感数据泄露\[Carlini2020\]和系统完整性受损\[derczynski2024garak\]——输出不忠实问题尤为紧迫\[wu2024clasheval\]。这一现象是指模型生成看似合理但实际捏造的信息,在问答和摘要任务中尤为关键\[evans2023hallucination,zhou2023detecting\]。我们特别关注上下文绑定式不忠实,即模型的响应偏离所提供的源材料\[jabbar2025red\]。有必要区分我们框架所处理的两类相关但本质不同的LLM脆弱性。正如一篇关于LLM红队测试的最新综述\[jabbar2025red\]所指出的,LLM脆弱性的格局涵盖了一组异质性风险,这些风险在文献中经常被混淆,尽管它们需要不同的评估方法:

- **事实不忠实**指生成与源材料相矛盾或捏造信息的内容——主要出现在问答和摘要任务中。
- **安全对齐失败**则指无论源材料如何,都会生成有害、冒犯性或违反政策的内容。

尽管两种脆弱性类型都受益于对抗性红队测试,但它们需要不同的评估标准和缓解策略,正如我们在任务特定实验设计(第4节 (https://arxiv.org/html/2606.25476#S4)–第6节 (https://arxiv.org/html/2606.25476#S6))中详述的那样。

挑战在多语言环境中进一步放大,因为模型必须应对语言变化和文化差异\[lin2023trustgpt\]。阿拉伯语-英语语言对由于结构差异带来独特挑战,增加了不忠实风险\[Ahmed2024\]。近期研究识别了多样化的攻击向量——提示注入\[Liu2023\]、数据投毒\[Kurita2020\]、模型提取\[Krishna2019\]和越狱\[Liu2023j\]——突显了稳健多语言评估框架的必要性\[wang2023multilingual\]。

### 1.1 我们的贡献

尽管现有红队测试框架取得了显著进展,但在可扩展性、跨语言评估以及对架构影响脆弱性的理解方面仍面临关键局限。我们的工作通过以下方面填补这些空白:

1. **新颖的多角色红队架构**:一个由攻击者、目标和陪审团LLM组成的三方系统,在严格信息流控制下进行协调评估——超越了单一角色方法。与依赖单一强大LLM配合精心设计提示的方法不同,我们的结构化多角色设计强制执行组件独立性(防止攻击成功率膨胀的反馈循环),并能进行带有定量可靠性度量的集成评估——这是单一模型设置无法提供的功能(详见第3节 (https://arxiv.org/html/2606.25476#S3)的详细论证)。

2. **自动化集成评估**:多个LLM配合共识机制(多数投票、一致同意)和定量裁判间可靠性度量(Fleiss’ kappa),消除了人工评估瓶颈。

3. **跨语言脆弱性分析**:结构化评估揭示阿拉伯语处理在问答和摘要任务中始终比英语表现出更高的脆弱性比率。

4. **任务自适应模块化框架**:该框架在核心组件(攻击者、目标、陪审团)可由任何LLM实例化的意义上是模块化的,其评估协议可适应不同脆弱性类型。统一度量通过任务特定的核心评估标准和攻击者策略调整,有效评估从事实不忠实到有害内容生成的各种脆弱性,而多角色架构和集成陪审团保持不变。

5. **架构设计观察**:来自24,000+次模型交互的经验证据表明,在所测试的模型家族中,架构设计选择似乎在决定模型安全性方面优于参数规模——这一模式需通过控制实验进一步验证。

6. **可操作的缓解策略**:简单的结构约束(如长度限制)可在无需模型重训练的情况下将不忠实降低高达30%。

这种多方面方法为开发更安全、更可信的多语言语言模型(跨不同应用)提供了理论见解和实际部署策略。

本文剩余部分组织如下。第2节 (https://arxiv.org/html/2606.25476#S2)回顾相关工作。第3节 (https://arxiv.org/html/2606.25476#S3)介绍我们的红队测试框架。第4节 (https://arxiv.org/html/2606.25476#S4)和第5节 (https://arxiv.org/html/2606.25476#S5)探讨问答和摘要任务中的不忠实问题。第6节 (https://arxiv.org/html/2606.25476#S6)研究有害内容生成。第7节 (https://arxiv.org/html/2606.25476#S7)综合跨任务发现。第8节 (https://arxiv.org/html/2606.25476#S8)讨论有效性威胁。第9节 (https://arxiv.org/html/2606.25476#S9)给出结论,第10节 (https://arxiv.org/html/2606.25476#S10)概述未来方向。

## 2 相关工作

LLM在关键应用中的日益部署要求对其安全脆弱性进行全面评估。我们回顾了四个关键领域的相关文献:安全性与稳健性、响应忠实度、攻击方法论,并指出我们的框架所填补的研究空白。表1 (https://arxiv.org/html/2606.25476#S2.T1)总结了我们的方法如何在现有红队测试框架基础上取得进展。在以下小节中,我们明确地将我们的方法与每类先前工作进行对比,突出我们的框架提供新颖能力的具体维度。

**表1:LLM红队测试框架对比**

| 框架       | 多角色架构 | 自动化评估 | 跨语言评估 | 无需人工标签 | 集成陪审团 | 任务自适应 |
|------------|------------|------------|------------|--------------|------------|------------|
| Perez et al.\[Perez2022\] | ✗          | 部分       | ✗          | ✗            | ✗          | ✗          |
| GARAK\[derczynski2024garak\] | ✗          | ✓          | ✗          | 部分         | ✗          | ✓          |
| AutoDAN\[zhu2023autodan\] | ✗          | ✓          | ✗          | ✓            | ✗          | ✗          |
| TAP\[mehrotra2023tree\] | 部分       | ✓          | ✗          | ✓            | ✗          | ✗          |
| MART\[ge2024mart\] | 部分       | ✓          | ✗          | ✗            | ✗          | ✗          |
| GOAT\[pavlova2024automated\] | 部分       | ✓          | ✗          | ✓            | ✗          | ✗          |
| HarmBench\[mazeika2024harmbench\] | ✗          | ✓          | ✗          | ✗            | ✗          | 部分       |
| MultiJail\[deng2023multilingual\] | ✗          | 部分       | ✓          | ✗            | ✗          | ✗          |
| **Our Framework** | **✓**      | **✓**      | **✓**      | **✓**        | **✓**      | **✓**      |

### 2.1 LLM安全性与稳健性

尽管GPT-4\[achiam2023gpt\]和PaLM\[chowdhery2023palm\]等模型具有先进能力,但LLM面临重大安全挑战,包括有害内容生成、隐私侵犯和固有偏见\[sun2024trustllm,ozkaya2023application\]。从基础NLP架构到当代Transformer模型的演进伴随着日益复杂的脆弱性表面,正如Siino等人\[siino2025foundations\]全面调查所示。研究已识别出跨越训练数据操纵(通过后门插入\[kurita2020weight\])、推理时攻击\[Carlini2020\]和信息提取\[carlini2022membership,wallace2020concealed\]的脆弱性。近期自动化框架推进了脆弱性检测——GARAK\[derczynski2024garak\]支持120+种攻击类型,而GOAT\[pavlova2024automated\]实现了97%的攻击成功率。像HarmBench\[mazeika2024harmbench\]这样的评估系统与人类判断的相关性超过0.9,JailJudge\[liu2024jailjudge\]引入了可解释性评分。然而,如表1 (https://arxiv.org/html/2606.25476#S2.T1)所示,这些框架缺乏全面的多角色架构和跨语言能力。相比之下,我们的框架独特地结合了表1 (https://arxiv.org/html/2606.25476#S2.T1)中列出的所有六种能力:多角色架构提供了GARAK和HarmBench所缺乏的结构化攻击者-目标-陪审团协调;带有定量可靠性度量的集成陪审团(Fleiss’ κ)超越了GOAT和JailJudge中的单一裁判或人类相关性评估;跨语言设计实现了MultiJail部分涵盖但缺少集成评估或任务自适应性的系统性阿拉伯语-英语比较。

语言脆弱性带来了特别的挑战,低资源语言利用在绕过安全措施方面成功率高达79%\[yong2023low\]。多语言部署中的隐私问题\[zhao2023multilingual\]以及自动化人格调制攻击将有害完成率从0.23%提升至42.5%\[shah2023scalable\],突显了当前安全机制中的关键缺口。

### 2.2 响应忠实度与幻觉

LLM幻觉中的系统模式显示,高达27%生成的事实包含捏造\[evans2023hallucination\],其比率因问题类型和文档上下文而显著不同\[jia2024improvedtechniquesoptimizationbasedjailbreaking,wang2023survey\]。摘要任务对复杂内容表现出明显更高的不忠实率\[zhang2023measuring\],在跨语言环境中进一步放大\[kim2023crosslingual\]。近期工作表明,提示工程技术可以作为有效的幻觉检测机制而无需模型重训练\[siino2025foundations\],而基于提示的自我检测方法显示Llama等模型可以被引导识别自身过度生成错误\[siino2024brainllama\],这些发现与我们关于结构约束无需重训练即可减少不忠实的观察相呼应。

多语言忠实度面临通过翻译引发的幻觉\[lee2023translation\]和文化语境错位\[chang2023cultural\]带来的独特挑战。事实一致性在不同语言对之间变化显著\[wu2023multilingual\],模型保持句法准确但语义保存失败\[zhao2024crosscultural\]。像XSafety\[wang2023all\]和MultiJail\[deng2023multilingual\]等近期框架揭示了系统性脆弱性,低资源语言中脆弱性比率高出3倍。检测方法已从简单的词汇重叠演进到复杂的语义相似度计算\[wang2023measuring\]、跨语言一致性检查\[chen2023crosslingual\]和无参考方法\[zhou2023detecting\]。层级框架现在区分从轻微不精确到完全捏造的幻觉程度\[thompson2023taxonomy\],揭示了需要专门缓解方法的任务依赖模式\[liu2023systematic\]。

### 2.3 攻击方法与红队测试

红队测试方法已从简单的提示注入\[perez2022red\]演进为复杂的操纵策略。直接注入技术发展为基于梯度的生成\[wichers2024gradient\],而通过外部数据源的间接操纵揭示了现实世界中的脆弱性\[greshake2023not\]。COLD-攻击框架\[guo2024cold\]引入了可控对抗攻击,在保持流畅性的同时损害忠实度。

先进的越狱技术展现出日益增加的复杂度:

- •通过场景嵌套的自动化生成(ReNeLLM\[ding2023wolf\])
- •通过演示池实现95%的成功率(I-FSJ\[zheng2024improvedfewshotjailbreakingcircumvent\])
- •利用思维树(TAP\[mehrotra2023tree\])的系统性改进
- •上下文感知的自主智能体(RedAgent)

相似文章

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。

RedBench:大型语言模型综合红队测试通用数据集

arXiv cs.CL

RedBench 引入了一个通用数据集,聚合了 37 个基准数据集,包含 29,362 个样本,涵盖 22 个风险类别和 19 个领域,用于实现大型语言模型的标准化和综合红队测试评估。该工作解决了现有红队测试数据集中的不一致问题,并提供了基准、评估代码和开源资源,用于评估 LLM 对对抗提示的鲁棒性。