理解语言模型为何产生幻觉:测试推理与先验知识之间的对抗
摘要
本文研究语言模型产生幻觉的原因,提出幻觉通常源于有偏的潜在推理(推理失配),而非知识缺失。它引入了TrapQA,一个受控的诊断测试平台,用于测试推理与先验知识之间的对抗,并证明幻觉可能源于误导性的潜在关联。
arXiv:2607.00447v1 公告类型:新
摘要:大型语言模型常常产生违反提示级约束的幻觉答案。一个关键的诊断问题是,这些失败是否反映了知识缺失,还是模型拥有相关信息但遵循了错误的推理路径。我们将这一现象研究为推理失配:提示所支持的答案与统计上显著的潜在关联所偏好的答案之间的不匹配。我们通过一个潜在关键任务模型形式化了这一观点,在该模型中,预训练频率不平衡可能导致捷径路径主导约束敏感路径,并引发正推理损失。该框架预测了两种失败模式:实体消歧中的任务检索偏差和动作选择中的关键选择偏差。我们引入了TrapQA,一个受控的诊断测试平台,包含两个组成部分。ScientistQA通过补充事实探针测试相似科学家之间的消歧,而Real-Life Constrained QA则在显著捷径下测试日常约束遵循。我们的结果表明,幻觉可能源于有偏的潜在推理,而非仅仅知识缺失。
查看缓存全文
缓存时间: 2026/07/02 05:37
# 理解语言模型为何产生幻觉:用先验知识测试推理能力 来源:https://arxiv.org/html/2607.00447 Yangfan Hu*Xuhan Tong∗Haoyue Bai∗ Xi DingShashank Muralidhar BharadwajSiyang CaoRobert NowakJiawei Zhang††footnotemark: 威斯康星大学麦迪逊分校 项目页面 (https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/) *同等贡献。作者顺序随机确定。 通信邮箱:\{haoyue.bai, jiawei.zhang\}@wisc.edu。 ###### 摘要 大型语言模型经常生成违反提示级别约束的幻觉式答案。一个关键的诊断问题是,这些失败是源于知识缺失,还是模型拥有相关信息但遵循了错误的推理路径。我们将此现象研究为*推理错位*:即提示所支持的答案与统计上显著的潜在关联所偏好的答案之间的不匹配。我们通过一个潜在键-任务模型来形式化这一观点,在该模型中,预训练频率不平衡可能导致捷径路径主导约束敏感路径,并引发正向推理损失。该框架预测了两种失败模式:实体消歧中的任务检索偏差和动作选择中的键选择偏差。我们引入了TrapQA,一个受控的诊断测试平台,包含两个部分。ScientistQA测试具有补充事实探针的相似科学家之间的消歧能力,而现实生活约束QA则测试在显著捷径下遵循日常约束的能力。我们的结果表明,幻觉可能源于有偏差的潜在推理,而不仅仅是知识缺失。 理解语言模型为何产生幻觉:用先验知识测试推理能力 Yangfan Hu††thanks:同等贡献。作者顺序随机确定。Xuhan Tong∗Haoyue Bai∗††thanks:通信邮箱:\{haoyue.bai, jiawei.zhang\}@wisc.edu。Xi DingShashank Muralidhar BharadwajSiyang CaoRobert NowakJiawei Zhang††footnotemark:威斯康星大学麦迪逊分校 项目页面 (https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/) ## 1 引言 大型语言模型(LLM)在许多任务上表现出色(OpenAI等人,2024 (https://arxiv.org/html/2607.00447#bib.bib66);Team等人,2025 (https://arxiv.org/html/2607.00447#bib.bib67);DeepSeek-AI等人,2025 (https://arxiv.org/html/2607.00447#bib.bib68);Grattafiori等人,2024 (https://arxiv.org/html/2607.00447#bib.bib69))。它们也越来越多地与工具和智能体工作流集成,例如网络搜索和外部服务(Nakano等人,2022 (https://arxiv.org/html/2607.00447#bib.bib70);Liu等人,2023 (https://arxiv.org/html/2607.00447#bib.bib71);Steinberger,2026 (https://arxiv.org/html/2607.00447#bib.bib65))。随着模型输出与现实世界动作的联系日益紧密,幻觉仍然是一个核心的可靠性风险。幻觉泛指流畅但事实错误、无依据或与上下文不忠实的输出(Ji等人,2023 (https://arxiv.org/html/2607.00447#bib.bib73);Huang等人,2025 (https://arxiv.org/html/2607.00447#bib.bib72))。当模型听起来自信或用户缺乏专业知识时,此类错误难以检测,并且在智能体环境中可能通过下游工具调用或事务被放大。重要的是,即使在良性输入下也可能出现幻觉,这使其成为一个固有的可靠性问题,而不仅仅是面对对抗性攻击时的失败(Zhang等人,2025b (https://arxiv.org/html/2607.00447#bib.bib74);Huang等人,2025 (https://arxiv.org/html/2607.00447#bib.bib72))。先前的工作通过训练数据偏差、解码动态以及归因或机制分析来研究幻觉(Dziri等人,2022 (https://arxiv.org/html/2607.00447#bib.bib5);Zhang等人,2023 (https://arxiv.org/html/2607.00447#bib.bib6);Sun等人,2025b (https://arxiv.org/html/2607.00447#bib.bib4);Gao等人,2025 (https://arxiv.org/html/2607.00447#bib.bib7))。现有的评估如TruthfulQA和HaluEval衡量了真实性和幻觉行为的重要方面(Lin等人,2022 (https://arxiv.org/html/2607.00447#bib.bib8);Li等人,2023 (https://arxiv.org/html/2607.00447#bib.bib12))。然而,一个核心的机制问题仍未充分探索:当模型失败时,它是缺乏所需的知识,还是它拥有相关事实但检索并应用了错误的推理路径?我们通过将幻觉解释为*推理错位*来探讨这个问题:即提示逻辑上支持的答案与统计上显著的学习关联所偏好的答案之间的不匹配。在我们的框架中,一个提示激活了潜在的键-任务路径。当一个高频率的捷径路径获得比提示所需的约束敏感路径更大的后验权重时,模型就会产生幻觉。这种观点预测,即使相关事实或约束可用,错误也可能发生:失败不仅在于存储的知识,还在于选择和组合适当的推理路径。 在这一理论的指导下,我们引入了TrapQA,一个闭卷诊断基准测试平台,包含两个互补的设置。ScientistQA针对*任务检索偏差*,即显著的实体-关系关联覆盖了区分性约束。现实生活约束QA针对*键选择偏差*,即表面显著的线索主导了任务相关约束。这些设置并非作为广泛覆盖的基准测试,而是作为潜在键-任务框架的受控测试。所有评估中均禁用了包括网络搜索在内的外部工具。 #### ScientistQA。ScientistQA测试在高度相似的科学家之间进行约束敏感的消歧。对于每一对,我们生成一段传记风格的段落,该段落与两个候选人都大致兼容,然后附加一个决定性的事实,该事实恰好排除其中一个候选人。模型必须选择与完整描述匹配的科学家。我们还包含了针对候选人特定事实的闭卷探针,从而能够区分知识缺失与知识部署失败。在涵盖GPT、Gemini、Claude和DeepSeek的2,925个问题和八种模型-推理配置中,幻觉率在检索敏感的仅姓名设置中从2.50%到37.23%不等。许多错误甚至在模型能单独正确回答相关探针事实时仍然存在,这表明是比较性知识部署的失败,而不仅仅是事实无知。 参见标题 图1:幻觉作为错位的推理。在动机性的ScientistQA示例中,模型通过遵循高显著性关联而低估了决定性的区分性约束,从而选择了错误的科学家。在禁用外部工具的情况下进行的直接闭卷探针显示,模型能够单独回答相关的候选人特定事实,这表明是比较性知识部署的失败,而不是简单的事实无知。 #### 现实生活约束QA。现实生活约束QA通过测试日常动作选择中的捷径失败来补充ScientistQA。我们从SWOW中的词汇关联开始(De Deyne等人,2019 (https://arxiv.org/html/2607.00447#bib.bib13)),将它们用作高显著性的捷径线索,并通过八个种子模板家族(如vehicle_required、delivery_medium、recording_medium和tool_required)进行组织。GPT实例化了自然的强制选择场景,其中一个选项表面上具有诱惑力但违反了提示所依据的物理、空间、程序或媒介特定约束。经过过滤和受控扰动后,最终集合包含500个问题,涵盖日常生活的13个方面。Claude、GPT、Gemini和DeepSeek分别犯了81、44、18和182个错误,对应的错误率为16.2%、8.8%、3.6%和36.4%。这些失败表明,推理错位并不限于百科全书式的实体消歧:当模型必须在日常现实世界约束下选择动作时,它也会出现。 #### 贡献。我们做出了三项贡献。(1)我们提出了一个潜在键-任务框架,该框架将幻觉形式化为由统计显著的捷径路径的后验主导性超过提示支持的约束敏感路径所导致的推理错位。(2)我们推导了理论预测,将预训练频率不平衡与捷径后验和正向推理损失联系起来,提供了即使在良性提示下也会出现幻觉的机制性解释。(3)我们引入了TrapQA,一个闭卷诊断基准测试平台,包含两个互补的设置,并在禁用外部工具的情况下评估了前沿模型家族,表明幻觉即使在孤立的事实知识存在时以及在提示所依据的现实世界约束下也可能持续存在。 ## 2 相关工作 语言生成中的幻觉早于最近的LLM时代。神经数据到文本系统可能生成流畅的输出,但未能反映底层记录(Wiseman等人,2017 (https://arxiv.org/html/2607.00447#bib.bib3));神经机器翻译模型可能生成看似合理但无源语言支持的翻译(Lee等人,2019 (https://arxiv.org/html/2607.00447#bib.bib2);Raunak等人,2021 (https://arxiv.org/html/2607.00447#bib.bib26));抽象式摘要模型通常生成与输入文档不忠实的内容(Maynez等人,2020 (https://arxiv.org/html/2607.00447#bib.bib1))。在这些设置中,幻觉反映了一个共同的失败模式:模型生成了合理的语言,但未能充分基于输入、检索到的证据或相关知识。 近期的工作从理论和实证两个角度研究幻觉。形式化解释表明,幻觉可能源于基本的学习或统计限制(Xu等人,2025 (https://arxiv.org/html/2607.00447#bib.bib15);Kalai和Vempala,2024 (https://arxiv.org/html/2607.00447#bib.bib32)),而机制解释则将幻觉追溯到生成过程中的竞争性关联或潜在状态动态(Sun等人,2025a (https://arxiv.org/html/2607.00447#bib.bib16);Cherukuri和Varshney,2026 (https://arxiv.org/html/2607.00447#bib.bib22))。其他工作将幻觉定位在LLM管道的各个阶段,包括预训练数据中的分布不平衡和噪声、微调期间获取新事实知识的困难,以及推理时对记忆化或频率偏差模式的依赖(Zhang等人,2025a (https://arxiv.org/html/2607.00447#bib.bib17);Liu等人,2026 (https://arxiv.org/html/2607.00447#bib.bib35);Gekhman等人,2024 (https://arxiv.org/html/2607.00447#bib.bib18);Zhang等人,2023 (https://arxiv.org/html/2607.00447#bib.bib6);McKenna等人,2023 (https://arxiv.org/html/2607.00447#bib.bib41);Berglund等人,2024 (https://arxiv.org/html/2607.00447#bib.bib42))。这表明幻觉不仅仅是知识缺失的问题;它也可能反映在特定提示的约束下检索、比较或应用知识的失败。附录C (https://arxiv.org/html/2607.00447#A3)提供了更全面的讨论,包括基于强化学习的缓解努力。 大量的基准测试评估生成文本的事实性和忠实性,包括TruthfulQA和HaluEval(Lin等人,2022 (https://arxiv.org/html/2607.00447#bib.bib8);Li等人,2023 (https://arxiv.org/html/2607.00447#bib.bib12)),长篇事实性基准测试如FActScore和LongFact(Min等人,2023 (https://arxiv.org/html/2607.00447#bib.bib62);Wei等人,2024b (https://arxiv.org/html/2607.00447#bib.bib61)),短篇事实性基准测试如SimpleQA(Wei等人,2024a (https://arxiv.org/html/2607.00447#bib.bib60)),以及检索增强生成基准测试如RAGTruth和FRAMES(Niu等人,2024 (https://arxiv.org/html/2607.00447#bib.bib58);Krishna等人,2025 (https://arxiv.org/html/2607.00447#bib.bib57))。这些基准测试主要衡量输出是否事实正确、忠实或基于证据。相比之下,我们的目标是诊断性的:Scientist QA和现实生活约束QA旨在隔离模型失败的原因。Scientist QA测试模型是否能在消歧中部署候选人特定事实,而现实生活约束QA则测试模型是否能用提示所依据的物理、空间、程序或媒介特定约束来覆盖SWOW衍生的关联线索(De Deyne等人,2019 (https://arxiv.org/html/2607.00447#bib.bib13))。这种设计使我们能够区分纯粹的无知与知识部署失败,在后一种情况下,相关信息对模型可用但未在相关的推理路径中使用。 ## 3 预训练频率在潜在推理中诱导幻觉 ### 3.1 幻觉作为推理错位 在LLM可靠性的研究中,*幻觉*通常被描述为生成事实错误或逻辑不一致的内容。然而,为了进行定量的数学分析,我们认为幻觉的潜在机制可以更精确地描述为*推理错位*。具体来说,令z\\bm\{z\}表示一个有界长度的提示序列。一个预训练的序列模型在延续上诱导出一个条件分布P\(⋅∣z\)P\(\\cdot\\mid\\bm\{z\}\)。我们进一步假设存在一个理想预测器,定义了与提示相关任务的正确推理过程的地面真实条件分布P⋆\(⋅∣z\)P\_\{\\star\}\(\\cdot\\mid\\bm\{z\}\)。为了分析,我们在光滑性质定义良好的嵌入空间中工作。概念上,模型的推理可以看作是沿着最优*推理路径*从预训练分布充分支持的区域移动到测试提示,当语义结构和任务意图被正确识别时,产生与P⋆\(⋅∣z\)P\_\{\\star\}\(\\cdot\\mid\\bm\{z\}\)一致的输出。然而,由于预训练语料库中存在的统计规律,模型可能反而依赖高频率的*捷径*。这些捷径使模型偏向于统计上占主导但语义不正确的推理路径。结果,模型可能遍历表示空间中训练数据支持较弱的区域,导致不稳定行为。在此视角指导下,我们将推理损失定义为模型预测分布与理想分布之间的差异:l\(z\):=∥P\(⋅\|z\)−P⋆\(⋅\|z\)∥TV\\ell\(\\bm\{z\}\):=\\\|P\(\\cdot\|\\bm\{z\}\)\-P\_\{\\star\}\(\\cdot\|\\bm\{z\}\)\\\|\_\{TV\},其中∥⋅∥TV\\\|\\cdot\\\|\_\{TV\}表示总变差距离。通过这种形式化,我们将幻觉的研究从文本不一致性的启发式描述转变为对推理行为的原则性分析。 ### 3.2 LLM推理的潜在键-任务模型 为了分析模型如何从预训练语料库泛化到新提示,我们引入了一个推理阶段的概念性抽象。令T=\{t1,...,tp\}\\mathcal\{T\}=\\\{t\_\{1\},\\dots,t\_\{p\}\\\}表示一个有限的潜在任务集合,令K=\{k1,...,km\}\\mathcal\{K\}=\\\{k\_\{1\},\\dots,k\_\{m\}\\\}表示一组任务信息的*键*。一个键代表提示中的一个显著特征模式(例如,词汇线索或结构模式),提供关于潜在任务的证据。我们将LLM推理建模为一个隐式的两阶段推理过程:z→识别键ki→检索任务tj\(ki\)→生成y。\\displaystyle\\bm\{z\}\\;\\xrightarrow\{\\text\{识别键\}\}\\;k\_\{i\}\\;\\xrightarrow\{\\text\{检索任务\}\}\\;t\_\{j\}\(k\_\{i\}\)\\;\\xrightarrow\{\\text\{生成\}\}\\;y。遵循贝叶斯视角相似文章
为什么语言模型会产生幻觉
OpenAI发布研究指出,语言模型产生幻觉的原因在于标准的训练和评估程序奖励猜测而不是承认不确定性,并建议评估指标应该优先考虑对局限性的诚实认识而不是原始准确率。
LLMs为何在结构化知识上产生幻觉:对线性化表示推理的机制分析
本文对LLMs在推理线性化结构化知识时产生幻觉的原因进行了机制分析,发现幻觉源于系统的内部动态,例如对捷径线索的关注以及前馈层中语义基础的失败,而非随机噪声。
从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
幻觉作为承诺失败:大型语言模型在知晓答案的情况下仍然犯错
本文研究了大型语言模型在其生成时间分布中已有正确答案时仍产生幻觉的现象。通过引入答案可用性的语义概念,作者表明16-47%的指令调优模型幻觉发生在正确概念已经表示的情况下,并且这一比例随着模型规模增加而上升。他们指出,指令调优强化了答案承诺,使得有用性和自信幻觉成为同一枚硬币的两面。
幻觉作为特性而非缺陷:评估多智能体架构将推测性语言模型输出转化为可测试科学假设的能力
本文提出了一种基于Rust的多智能体架构,利用LLM幻觉作为特性来生成和评估科学假设,并将其性能与直接提示和其他方法进行比较。