当上下文反噬:通过文档级注意力崩溃检测RAG投毒

Hugging Face Daily Papers 论文

摘要

本文提出D-SCAN,一种针对RAG投毒的检测框架,通过监控语言模型生成中的注意力崩溃动态,即使在输出看似良性时,也能有效抵御对抗性攻击。

检索增强生成(RAG)对于提升大语言模型至关重要。然而,RAG系统日益易受投毒攻击,即注入对抗性文档以操纵生成器输出。以往的方法依赖于输出端信号,如困惑度和一致性检查,来检测此类攻击。然而,我们的分析表明,蓄意攻击常引发虚假置信,即受毒输出的困惑度甚至低于良性输出,使得基于不确定性的检测失效。为应对这一挑战,我们探索生成器的内部动态,并识别出一个独特特征,称为注意力崩溃。与良性生成中的分散注意力不同,攻击生成中随着注意力集中于受毒文档,熵值降低。基于这些发现,我们提出D-SCAN(文档级信号崩溃分析),一种轻量级检测框架,通过监控注意力动态来识别攻击生成。在多个攻击基准上的大量实验证明了我们方法的有效性。此外,即使攻击未能改变最终答案,D-SCAN也能检测到。代码可在 https://github.com/yingtaoren/D-Scan.git 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:51

论文页面 - 当上下文反噬:通过文档级注意力坍缩检测RAG投毒攻击

来源: https://huggingface.co/papers/2608.06947
发布于8月7日

·

由https://huggingface.co/An998提交

an998 (https://huggingface.co/An998) 于8月18日发布

摘要

D-SCAN 通过监测语言模型生成过程中的注意力坍缩动态来检测检索投毒攻击。

检索增强生成(https://huggingface.co/papers?q=Retrieval-augmented%20generation)(RAG)对于增强大语言模型不可或缺。然而,RAG 越来越容易受到投毒攻击(https://huggingface.co/papers?q=poisoning%20attacks),其中恶意文档被注入以操纵生成器输出。先前的方法依赖于输出侧信号,如困惑度(https://huggingface.co/papers?q=perplexity)和一致性检查来检测此类攻击。然而,我们的分析表明,精心设计的攻击往往会诱发“虚假置信”,即被投毒的输出表现出比良性输出更低的困惑度(https://huggingface.co/papers?q=perplexity),这使得基于不确定性的检测方法失效。为解决这一挑战,我们探索了生成器的内部动态,并识别出一个被称为注意力坍缩(https://huggingface.co/papers?q=Attention%20Collapse)的独特特征。与良性生成中分散的注意力不同,受攻击的生成在注意力集中于投毒文档时表现出熵的降低。基于这些发现,我们提出了D-SCAN(https://huggingface.co/papers?q=D-SCAN)(文档级信号坍缩分析),一个通过监测注意力动态来识别受攻击生成的轻量级检测框架。在多个攻击基准上的广泛实验证明了我们方法的有效性。此外,D-SCAN(https://huggingface.co/papers?q=D-SCAN)即使在攻击未能改变最终答案时也能进行检测。代码已发布于 https://github.com/yingtaoren/D-Scan (https://huggingface.co/papers?q=D-Scan).git\。

查看 arXiv 页面 (https://arxiv.org/abs/2608.06947) 查看 PDF (https://arxiv.org/pdf/2608.06947) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06947)

在你的代理中获取此论文:

hf papers read 2608\.06947

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.06947 以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.06947 以从本页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.06947 以从本页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

arXiv cs.CL

本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。

TopoGuard:基于图论的RAG Split-Knowledge攻击防御

arXiv cs.CL

介绍了TopoGuard,这是一种基于图论的防御方法,用于抵御RAG系统中的Split-Knowledge攻击。该攻击中,多个单独无害的文档组合后会产生有害输出。该方法通过构建语义相似度图来检测恶意上下文,性能显著优于现有的逐文档过滤器(如LlamaGuard)。

RAGognizer:通过检测头集成实现幻觉感知微调

arXiv cs.CL

RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。