面向自然语言理解任务的混合对抗防御框架

arXiv cs.CL 论文

摘要

来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。

arXiv:2606.04612v1 公告类型:新论文 **摘要:** 大语言模型(LLMs)既容易产生幻觉,也容易受到对抗性操控的影响。尽管这两个问题密切相关,但现有的防御方法通常将其分开处理。我们研究了一种混合防御框架,将旨在减少幻觉的基于熵的模型与旨在降低漏洞的基于不确定性模型和基于几何模型相结合。在自然语言理解数据集(FEVER、HotpotQA、CSQA、SIQA)的域内测试中,我们发现混合模型在干净任务性能(准确率最高提升 43.34%)和对抗鲁棒性(准确率最高提升 64.92%,攻击成功率最高降低 62.27%)两方面均有所改善。在分布外数据集(AeroEngQA、CPIQA)上,混合模型同样展现出相近的对抗鲁棒性(准确率最高提升 57.14%)。在提示注入(SafeGuard)和越狱检测(AdvBench、DAN)数据集上,混合模型表现同样出色(与最先进基线模型相比,攻击成功率最高降低 51%)。总体而言,我们的结果表明,在域内和分布外任务中,将熵、不确定性和几何特征相结合,能够提供比单独使用任一特征更为有效的防御策略。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:16

# 面向自然语言理解任务的混合对抗防御

来源:https://arxiv.org/html/2606.04612
Manar Abouzaid¹,Yang Wang²,Chenghua Lin²,Stuart E. Middleton¹ ¹英国南安普顿大学电子与计算机科学学院 ²英国曼彻斯特大学计算机科学系

###### 摘要

大型语言模型(LLM)既容易产生幻觉,也容易受到对抗性操控。尽管这两个问题密切相关,现有防御方法通常分别加以处理。我们研究了一种混合防御框架,将旨在减少幻觉的基于熵的模型,与旨在降低脆弱性的基于不确定性的模型和基于几何的模型相结合。在自然语言理解数据集(FEVER、HotpotQA、CSQA、SIQA)的域内测试中,我们发现混合模型在干净任务性能(准确率最高提升 43.34%)和对抗鲁棒性(准确率最高提升 64.92%,攻击成功率最高降低 62.27%)两方面均有改善。对于域外数据集(AeroEngQA、CPIQA),我们的混合模型同样表现出相似的对抗鲁棒性(准确率最高提升 57.14%)。在提示注入(SafeGuard)和越狱检测(AdvBench、DAN)数据集上,我们的混合模型也表现极为出色(与最先进的基线模型相比,攻击成功率最高降低 51%)。总体而言,我们的结果表明,将熵、不确定性和几何特征相结合,比单独使用任何一种特征在域内和域外任务上都能提供更有效的防御策略。

面向自然语言理解任务的混合对抗防御

## 1 引言

大型语言模型(LLM)已成为现代人工智能系统的重要组成部分(Brown et al., 2020 (https://arxiv.org/html/2606.04612#bib.bib7);Touvron et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib42))。尽管其能力令人印象深刻,两个众所周知的问题仍持续困扰着大型语言模型:幻觉和对抗脆弱性。

本文探讨了能否将针对幻觉和对抗攻击的方法整合在单一框架内,从而提升 LLM 在自然语言理解(NLU)任务上的鲁棒性。我们的动机源于以下观察:目前文献中已涌现出几类截然不同的幻觉减少与对抗防御模型,这些模型很可能各自具有不同的误差分布。如果我们能够学会何时使用哪类模型,就能开发出一种强大的混合对抗防御方法。我们使用的第一类模型是基于熵的模型,受 Yao et al.(2023 (https://arxiv.org/html/2606.04612#bib.bib48))的启发,用于减少幻觉。第二类是能够回答"我不知道"的不确定性训练模型,受 Zhang et al.(2024 (https://arxiv.org/html/2606.04612#bib.bib51))的启发。第三类是基于几何的模型,受 Wang et al.(2025 (https://arxiv.org/html/2606.04612#bib.bib45))的启发,通过去除主要主成分来改善隐藏状态。为了聚合这些防御,我们引入了一个选择器网络,学习将输入路由到三个专家模型。路由决策基于捕获熵特征、不确定性估计以及模型内部表示几何属性的特征。我们同时探索了硬专家选择和软概率聚合两种防御特征聚合方式。我们将我们的模型¹作为开源发布以便复现。

我们研究以下几个研究问题:

- **RQ1** 基于 token 级别的域内对抗防御方法(基于熵、基于不确定性、基于几何)能否在提升鲁棒性的同时改善 NLU 任务的基础性能?
- **RQ2** 混合对抗防御方法能否在域内和域外任务上均优于单一对抗防御方法?
- **RQ3** token 级别的防御机制能否泛化到基于序列的攻击,如提示注入和越狱尝试?

本文的主要贡献如下:

- 我们提出了首个使用熵、不确定性和几何特征来选择对抗防御模型的混合对抗防御方法。我们的混合对抗防御在多种域内 NLU 数据集(FEVER、HotpotQA、CSQA、SIQA)上,无论是任务性能还是鲁棒性,均持续优于最先进的模型。
- 我们对混合对抗防御在域外和基于序列的攻击问题上的表现进行了全面分析。我们的混合对抗防御在所有域外(AeroEngQA、CPIQA)、提示注入(SafeGuard)数据集以及越狱(AdvBench、DAN)数据集上均优于任何单一模型,唯一例外是 DAN 数据集,其中专门针对该数据集优化的 NeMoGuard 模型表现最佳。

## 2 相关工作

### 2.1 幻觉减少

大型语言模型(LLM)的幻觉(Zhang et al., 2025b (https://arxiv.org/html/2606.04612#bib.bib52);Ji et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib21))是指那些措辞自信、行文流畅,但包含事实错误或无意义内容的回复。近期大规模研究证实了幻觉问题的持续普遍性(Masson et al., 2025 (https://arxiv.org/html/2606.04612#bib.bib29))。LLM 幻觉减少的研究主要集中在以下几个方面:提升回复对原始输入的忠实度、回复的事实准确性,以及回复一致性以减少矛盾。

近期提升 LLM 忠实度的工作包括:基于熵的方法,用于检测 LLM 回复中的统计异常,例如 LLMLies(Yao et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib48));以及不确定性感知训练,使模型在超出知识阈值时能够拒绝回答问题,例如 R-Tuning(Zhang et al., 2024 (https://arxiv.org/html/2606.04612#bib.bib51))。检索增强生成(RAG)(Lewis et al., 2020 (https://arxiv.org/html/2606.04612#bib.bib25))长期以来通过从可信来源检索上下文来提升 LLM 的事实准确性。其他提升事实准确性的方法包括:使用语义熵指标(Zubkova et al., 2025 (https://arxiv.org/html/2606.04612#bib.bib54))来决定何时使用预训练 LLM 知识、何时通过 RAG 进行增强;基于困惑度的指标(Varshney et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib43))以避免不自然的域外回复;以及知识注入 Elaraby et al.(2023 (https://arxiv.org/html/2606.04612#bib.bib11)),利用经专家验证的知识集填补特定事实空缺,否则这些空缺将导致 LLM 产生幻觉。近期提升 LLM 一致性的工作包括:基于知识图谱的生成再精炼策略(Dziri et al., 2021 (https://arxiv.org/html/2606.04612#bib.bib9));使用蕴含模型(Maynez et al., 2020 (https://arxiv.org/html/2606.04612#bib.bib30))评估抽象摘要质量;以及自一致性方法(Manakul et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib28)),期望相似概念的回复具有相似性并包含一致的事实。

我们的工作同时使用基于熵和基于不确定性的方法来减少 LLM 幻觉,但我们在将它们与基于几何的对抗防御相聚合的背景下进行,这是此前从未探索过的方向。

### 2.2 对抗防御

对抗防御旨在使 LLM 对对抗攻击(如恶意输入扰动、提示注入和 LLM 越狱)更具鲁棒性。目前有多个对抗攻击框架可用于测试 LLM,例如 TextAttack(Morris et al., 2020 (https://arxiv.org/html/2606.04612#bib.bib31))、TextFooler(Jin et al., 2020 (https://arxiv.org/html/2606.04612#bib.bib22))、TextBugger(Li et al., 2018 (https://arxiv.org/html/2606.04612#bib.bib26))和 PWWS(Ren et al., 2019 (https://arxiv.org/html/2606.04612#bib.bib35))。越狱攻击(Wei et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib46))(Ding et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib56))(Zhang et al., 2025a (https://arxiv.org/html/2606.04612#bib.bib57))(Fu et al., 2025 (https://arxiv.org/html/2606.04612#bib.bib58))利用 LLM 中的漏洞,可能绕过对齐约束,而提示注入攻击则可以绕过系统指令(Greshake et al., 2023 (https://arxiv.org/html/2606.04612#bib.bib16))。近期研究表明,当前的 LLM 护栏系统仍可能被攻击攻破(Hackett et al., 2025 (https://arxiv.org/html/2606.04612#bib.bib17))。

对抗防御方法包括对抗训练、扰动控制以及在训练中使用正则化以增强模型鲁棒性。对抗训练通过在训练数据中加入对抗扰动来进行增强,可以是使用对抗攻击框架显式添加新的对抗数据实例,也可以是在嵌入阶段动态调整训练数据来隐式增强。隐式扰动的例子包括 Gao et al.(2023 (https://arxiv.org/html/2606.04612#bib.bib14))、Latorre et al.(2023 (https://arxiv.org/html/2606.04612#bib.bib23))以及 FreeLB(Zhu et al., 2020 (https://arxiv.org/html/2606.04612#bib.bib55))。值得注意的是,对抗训练通常计算成本较高,因为它增加了训练数据量,并在微调时需要更多训练时间。扰动控制是指模型在训练过程中识别并纠正扰动。相关例子包括拼写检查(Basemah Alshemali, 2019 (https://arxiv.org/html/2606.04612#bib.bib1))、在扰动集已知的情况下进行同义词替换(Dong et al., 2021 (https://arxiv.org/html/2606.04612#bib.bib8)),以及数据清洗(Bao et al., 2021 (https://arxiv.org/html/2606.04612#bib.bib5))以限制对抗数据输入空间。正则化类方法专注于在训练时奖励模型以鼓励鲁棒性,例如 Wang et al.(2021 (https://arxiv.org/html/2606.04612#bib.bib44))使用两个正则化项来提升域外鲁棒性,以及 Bianchi et al.(2024 (https://arxiv.org/html/2606.04612#bib.bib6))将对抗训练与强化学习相结合以增强鲁棒性。其他方法还包括 PURE(Wang et al., 2025 (https://arxiv.org/html/2606.04612#bib.bib45)),通过去除隐藏表示中的主要主成分创建更各向同性的空间来提升鲁棒性;SafeLoRA(Hsu et al., 2024 (https://arxiv.org/html/2606.04612#bib.bib19)),将 LoRA 权重投影到以安全为核心的子空间以降低安全风险;以及 SPLoRA(Ao et al., 2025 (https://arxiv.org/html/2606.04612#bib.bib2)),剪枝与预训练 LLM 状态偏差较大且可能引入安全漏洞的 LoRA 层。

据我们所知,此前没有任何对抗防御工作像本文这样探索聚合基于熵、基于不确定性和基于几何的方法,以弥合幻觉与对抗防御方法之间的差距。

## 3 混合对抗防御框架

我们的混合对抗防御框架如图 1 (https://arxiv.org/html/2606.04612#S3.F1) 所示,由三个独立的对抗防御模型和两种可选的聚合方法组成。输入查询首先被送入各独立防御模型,分别为基于熵、基于不确定性和基于几何的对抗防御模型。聚合方法随后利用每个独立模型提供的各类特征训练路由算法,最终对输入查询给出是否接受的对抗防御决策。

### 3.1 基于熵的模型

我们的基于熵的对抗防御模型受 Yao et al.(2023 (https://arxiv.org/html/2606.04612#bib.bib48))工作的启发,该工作使用基于梯度的对抗生成。对于每个 token 位置 $i$,原始方法针对 token 嵌入计算梯度,识别复杂度为 $O(T \times L \times K \times V)$ 的前 $k$ 个替换 token,其中 $T$ 为训练轮数,$L$ 为输入长度,$K$ 为前 $k$ 个候选数量,$V$ 为词表大小。

我们不使用原始的基于梯度的生成器,而是采用 Morris et al.(2020 (https://arxiv.org/html/2606.04612#bib.bib31))的 TextAttack 框架来生成对抗样本。这一实用选择大幅提升了运行速度,使大规模评估成为可能,并产生了适合测试基于熵检测的有效对抗输入。附录 B (https://arxiv.org/html/2606.04612#A2) 对所使用的攻击配方进行了总结。

我们使用基于熵的阈值机制在推理过程中拒绝对抗提示。对抗输入会引发不确定性,导致词表上的分布熵更高。在推理时,熵 $H$ 按公式(1 (https://arxiv.org/html/2606.04612#S3.E1))在第一个预测 token 的 softmax 归一化 logits 上计算,其中 $p_i$ 表示词表 $V$ 中 token $i$ 的 softmax 概率。

$$H = -\sum_{i=1}^{V} p_i \log p_i \tag{1}$$

若熵超过设定阈值,则将该提示标记为对抗性并予以拒绝。这提供了一种简单高效的对抗提示防御方式,无需重新训练模型。与 Yao et al.(2023 (https://arxiv.org/html/2606.04612#bib.bib48))使用统一熵阈值不同,我们采用根据每个领域内观测到的平均熵计算出的数据集特定阈值。这提升了在不同任务类型和数据集上的检测鲁棒性。

### 3.2 基于不确定性的模型

我们的基于不确定性的对抗防御模型受 Zhang et al.(2024 (https://arxiv.org/html/2606.04612#bib.bib51))的拒绝感知指令微调(R-Tuning)方法的启发,该方法通过训练模型识别知识边界并表达适当的不确定性来解决幻觉问题。给定预训练参数化知识($P$)和指令微调知识($I$),模型的可靠知识空间($P \cap I$)是期望给出自信回答的区域,而该交集之外的问题($I \setminus P$)则属于不确定范畴,应予以拒绝。

训练数据集 $D = \{(q_1, a_1), \ldots, (q_n, a_n)\}$ 按公式(2 (https://arxiv.org/html/2606.04612#S3.E2))基于预训练模型的参数化知识划分为确定子集($D_1$)和不确定子集($D_0$)。对于每个问答对 $(q_i, a_i)$,预训练模型 $M_0$ 在不经过微调的情况下生成预测 $\hat{a}_i$。

$$\hat{a}_i = M_0(q_i) \tag{2}$$

$$\begin{aligned} (q_i, a_i) &\in D_1 \text{ 若 } \hat{a}_i = a_i \text{(确定)} \\ (q_i, a_i) &\in D_0 \text{ 若 } \hat{a}_i \neq a_i \text{(不确定)} \end{aligned}$$

$$\text{模板} = \text{``Q: \{Question\}, A: \{Answer\}. \{Uncertainty\_Prompt\}''} \tag{3}$$

拒绝感知训练数据集使用标准化模板(3.2 (https://arxiv.org/html/2606.04612#S3.Ex3))构建,该模板将问题、答案和不确定性评估相结合,其中 Uncertainty\_Pro……

相似文章

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。