当审计员伪造时:大语言模型检测植入文档污染中的批量大小退化与自信幻觉
摘要
本文研究了大语言模型在检测植入文档污染物时,随着批量大小增加如何退化,导致对不存在的错误产生自信幻觉,并建议使用有界批量大小和验证机制以实现可靠审计。
arXiv:2609.09696v1 公告类型:新
摘要:大语言模型越来越多地被提议作为文档质量的自动审计员,但它们作为植入错误检测器的可靠性尚未得到充分表征。我们构建了一个包含150篇学术论文的污染语料库,涵盖供应链管理和医学研究,注入了450个已知污染物,分为三种类型:拼写错误、语义反转和荒谬的上下文外插入。然后,我们评估了Google Gemini 3.0 Pro在三种不同规模的提示机制下:单文档、小批量和大批量,从60个文档中恢复180个污染物的答案键子集的能力。检测在小规模时保持稳定,然后崩溃:单文档恢复率为50%,小批量为60%,大批量仅为2.8%。大规模时的失败模式不是拒绝而是伪造。模型没有报告处理不完整,而是产生了自信的发现,包括它自己发明的污染物,如“心灵感应松鼠”和“量子动力烤面包机”等荒谬事物,这些模仿了植入材料的风格,但并未出现在任何文档中。检测还因污染物类型而异:在完成的评估中,荒谬插入的恢复率为75%,而语义反转和拼写错误的恢复率各仅为50%。在野外最可能发生的、合理的错误,恰恰是最常被遗漏的。我们得出结论,大语言模型的文档审计不是优雅退化,而是欺骗性退化,并概述了此类系统所需的约束:有界批量大小、直接内容注入以及对每个报告发现与源文本的机械验证。
查看缓存全文
缓存时间: 2026/09/10 08:14
# 当审计员伪造内容:LLM检测植入文档污染中的批量规模退化与置信幻觉 来源:https://arxiv.org/abs/2609.09696 查看PDF (https://arxiv.org/pdf/2609.09696) > 摘要:大型语言模型越来越多地被提议作为文档质量的自动化审计员,但其作为植入错误检测器的可靠性尚缺乏充分评估。我们构建了一个包含150篇涵盖供应链管理与医学研究领域的学术论文的污染语料库,注入了450个已知的三种类型污染物:拼写错误型破坏、语义颠倒和荒谬的上下文外插入。随后,我们评估了Google Gemini 3.0 Pro在三种渐进规模提示模式(单文档、小批量、大批量)下,在60篇文档中恢复180个污染物答案键子集的能力。检测能力在小规模下保持稳定,随后崩溃:单文档检出率50%,小批量60%,大批量仅2.8%。大规模下的失败模式并非拒绝处理而是主动伪造。模型未报告处理不完整,反而生成了包括自行发明的污染物在内的“置信发现”,诸如“心灵感应松鼠”和“量子动力烤面包机”等荒谬内容,这些内容模仿了植入材料的风格,但实际并未出现在任何文档中。检测效果也因污染类型而异:荒谬插入物在完成评估中的恢复率为75%,而语义颠倒和拼写破坏的恢复率均仅为50%。在真实场景中最可能出现的合理污染类型,恰恰是最常被遗漏的。我们的结论是,LLM文档审计的退化并非渐进式,而是具有欺骗性。本文据此提出了此类系统所需的管控框架:限定批量大小、直接内容注入,以及针对每个报告发现进行与源文本的机械式核验。 ## 提交历史 来自:Karan Parekh \[查看邮件 (https://arxiv.org/show-email/557a3143/2609.09696)\] **\[版本1\]** 2026年9月9日,周三,协调世界时04:29:45(99 KB)
相似文章
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
LLMs中的幻觉:基于生命周期的成因、检测、缓解与预防综述
这篇综述论文提出了一种基于生命周期的框架,用于理解LLMs中的幻觉现象,涵盖数据、训练和推理阶段的成因、检测、缓解与预防。
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。
信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式
本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。