当上下文反噬:通过文档级注意力崩溃检测RAG投毒
摘要
本文提出D-SCAN,一种针对RAG投毒的检测框架,通过监控语言模型生成中的注意力崩溃动态,即使在输出看似良性时,也能有效抵御对抗性攻击。
查看缓存全文
缓存时间: 2026/08/18 03:51
论文页面 - 当上下文反噬:通过文档级注意力坍缩检测RAG投毒攻击
来源: https://huggingface.co/papers/2608.06947
发布于8月7日
·
由https://huggingface.co/An998提交
an998 (https://huggingface.co/An998) 于8月18日发布
摘要
D-SCAN 通过监测语言模型生成过程中的注意力坍缩动态来检测检索投毒攻击。
检索增强生成(https://huggingface.co/papers?q=Retrieval-augmented%20generation)(RAG)对于增强大语言模型不可或缺。然而,RAG 越来越容易受到投毒攻击(https://huggingface.co/papers?q=poisoning%20attacks),其中恶意文档被注入以操纵生成器输出。先前的方法依赖于输出侧信号,如困惑度(https://huggingface.co/papers?q=perplexity)和一致性检查来检测此类攻击。然而,我们的分析表明,精心设计的攻击往往会诱发“虚假置信”,即被投毒的输出表现出比良性输出更低的困惑度(https://huggingface.co/papers?q=perplexity),这使得基于不确定性的检测方法失效。为解决这一挑战,我们探索了生成器的内部动态,并识别出一个被称为注意力坍缩(https://huggingface.co/papers?q=Attention%20Collapse)的独特特征。与良性生成中分散的注意力不同,受攻击的生成在注意力集中于投毒文档时表现出熵的降低。基于这些发现,我们提出了D-SCAN(https://huggingface.co/papers?q=D-SCAN)(文档级信号坍缩分析),一个通过监测注意力动态来识别受攻击生成的轻量级检测框架。在多个攻击基准上的广泛实验证明了我们方法的有效性。此外,D-SCAN(https://huggingface.co/papers?q=D-SCAN)即使在攻击未能改变最终答案时也能进行检测。代码已发布于 https://github.com/yingtaoren/D-Scan (https://huggingface.co/papers?q=D-Scan).git\。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06947) 查看 PDF (https://arxiv.org/pdf/2608.06947) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06947)
在你的代理中获取此论文:
hf papers read 2608\.06947
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.06947 以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06947 以从本页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.06947 以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
RAGuard: 一种针对检索增强生成系统的分层防御框架,用于防御数据投毒
RAGuard 是一种针对检索增强生成(RAG)系统的分层防御框架,它利用检索器的对抗性微调以及一种无标签过滤器(ZKIP),在对语料库投毒攻击中实现零攻击成功率,同时保持较高的检索准确率。
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
TopoGuard:基于图论的RAG Split-Knowledge攻击防御
介绍了TopoGuard,这是一种基于图论的防御方法,用于抵御RAG系统中的Split-Knowledge攻击。该攻击中,多个单独无害的文档组合后会产生有害输出。该方法通过构建语义相似度图来检测恶意上下文,性能显著优于现有的逐文档过滤器(如LlamaGuard)。
RAGognizer:通过检测头集成实现幻觉感知微调
RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。
研究求助:观察——语义密集上下文无需越狱提示即可引发强后期层发散 [D]
一项实证研究表明,长篇幅、语义密集且良性的文本能够偏移模型的潜在空间并绕过对齐,促使其生成原本被屏蔽的评论。作者并非专家,请求对其指标进行审计,以区分真正的语义劫持与假象。