通过语义等价的对抗性攻击诱发LLM的内在幻觉

arXiv cs.CL 论文

摘要

本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。

arXiv:2608.04286v1 公告类型:新 摘要:大型语言模型(LLM)通常与外部知识源结合使用,通过检索增强生成(RAG)等方法提高事实准确性并减少幻觉。然而,这些系统仍然容易受到内在幻觉的影响,即模型生成的、未被检索证据支持的不忠实或捏造的信息。我们提出了一种新颖的框架,通过使用对抗优化方法发现的自然、语义等价的用户查询变体进行压力测试,来评估模型对此现象的鲁棒性。我们将该框架(强制执行严格的语义等价约束和内在幻觉目标)应用于白盒、灰盒和黑盒对抗设置下的各种对抗攻击技术。在3个数据集上对5个开源和5个闭源生成模型评估这些攻击,我们证明即使是最先进的模型也很容易受到保持语义不变的扰动的影响,这些扰动显著降低了上下文忠实度(对于GPT-5-mini高达50%)。我们的研究结果表明,即使在最先进的LLM中,对上下文证据的忠实使用仍然脆弱,这促使我们设计能够强制稳健接地(独立于表面查询形式)的架构和训练目标。代码可在以下网址获取:https://github.com/atriviveksharma/intrinsic_hall
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:45

# 通过语义等价对抗攻击诱发大语言模型的内在幻觉
来源:https://arxiv.org/html/2608.04286  
Atri Vivek Sharma1,2, Brian Formento2, Alessio Lomuscio1,2  
1Imperial College London  
2Safe Intelligence  
[email protected]

###### 摘要

大语言模型(LLMs)通常与外部知识源结合使用,通过检索增强生成(RAG)等方法提高事实准确性并减少幻觉。然而,这类系统仍然容易受到内在幻觉的影响,即模型生成未被检索证据支持的不忠实或编造信息。我们提出一个新框架,通过使用对抗优化方法发现的自然且语义等价的用户查询变体进行压力测试,来评估模型对此现象的鲁棒性。我们应用该框架(强制严格的语义等价约束和内在幻觉目标)到多种对抗攻击技术,涵盖白盒、灰盒和黑盒对抗设置。我们在3个数据集上、对5个开源和5个闭源生成器模型评估这些攻击,证明即使最先进的模型也极易受到保持语义的扰动的影响,这些扰动显著降低了上下文忠实度(GPT-5-mini最高下降50%)。我们的研究结果表明,即使是最先进的LLM,对上下文证据的忠实使用仍然脆弱,这促使我们设计能够强制模型在查询表面形式之外建立稳健上下文依据的架构和训练目标。111代码可在以下网址获取:https://github.com/atriviveksharma/intrinsic_hall

## 1 引言

大语言模型正越来越多地部署到现实应用中,通常在检索增强生成(RAG)[Lewis et al., 2020](https://arxiv.org/html/2608.04286#bib.bib19) 的设置中,模型基于检索到的上下文生成响应。这种方法很有前景,因为它极大地提高了响应准确性,并使得可使用本地部署的小型高效模型来处理最新或专有信息 [Shuster et al., 2021](https://arxiv.org/html/2608.04286#bib.bib36) [Arslan et al., 2024](https://arxiv.org/html/2608.04286#bib.bib2)。

图1:语义等价对抗攻击可以诱发内在幻觉,即LLM生成与其上下文不忠实的响应。与先前越狱方法不同,它们产生具有语义差异的不自然查询,而我们的框架强制严格的语义等价,显示跨模型和数据集的显著忠实度下降。

然而,尽管有这些进展,RAG系统仍然容易产生幻觉 [Niu et al., 2024](https://arxiv.org/html/2608.04286#bib.bib32) [Mohsin et al., 2025](https://arxiv.org/html/2608.04286#bib.bib29),即模型生成的信息既可能不受其训练数据支持(外在幻觉),也可能不受所提供上下文支持(内在幻觉)[Bang et al., 2025](https://arxiv.org/html/2608.04286#bib.bib4)。内在幻觉可能源于上下文与模型参数知识之间的冲突 [Zhao et al., 2025](https://arxiv.org/html/2608.04286#bib.bib49) [Huang et al., 2025](https://arxiv.org/html/2608.04286#bib.bib14),也可能源于检索上下文中的信息丢失 [Laban et al., 2024](https://arxiv.org/html/2608.04286#bib.bib18) [Wu et al., 2025](https://arxiv.org/html/2608.04286#bib.bib44)。这在医疗保健 [Kim et al., 2025](https://arxiv.org/html/2608.04286#bib.bib17)、法律 [Wiratunga et al., 2024](https://arxiv.org/html/2608.04286#bib.bib43) 和企业应用等高风险领域尤其令人担忧,因为这些场景中不忠实的生成可能导致重大危害。在此类部署中,用户可能会以多种措辞表达同一输入,而一个可信赖的RAG系统应在语义等价的输入变体

相似文章

理解LLM中新知识诱导的事实幻觉:分析与解释

arXiv cs.CL

本论文探究了在新知识上微调LLM如何诱导事实幻觉,研究表明特定知识类型内的陌生性通过削弱对关键实体的注意力来驱动幻觉。作者提议通过在后期训练阶段重新引入已知知识来缓解这一问题。

面向自然语言理解任务的混合对抗防御框架

arXiv cs.CL

来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。

毒性幻觉:扰动提示并追踪LLM电路

arXiv cs.CL

本文研究了提示中的毒性词汇扰动如何降低LLM的事实准确性并增加不确定性,并使用归因图分析追踪内部变化。研究发现,增加毒性会放大对扰动敏感的变异节点,而核心推理节点保持不变。