从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
摘要
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
arXiv:2606.07537v1 公告类型:cross
摘要:大型语言模型会产生幻觉——输出流畅、自信但事实错误的内容——这种一致性在不同代际和规模中持续存在。现有的分类法按输出类型对幻觉进行分类,区分内在失败与外在失败,以及忠实性与事实性分歧。这些框架在描述上很严谨,但未能识别出产生特定实例的内部机制。本文分析了幻觉作为三个架构决策的结构性后果,这些决策共同形成了一个复合故障系统。自注意力的共现学习用统计接近性替代语义含义,导致实体混淆、事实错误归因和语义漂移。最大似然估计训练目标在没有事实约束的情况下优化下一个词元的概率,奖励统计上合理的输出,无论其真实值如何。自回归解码在暴露偏差下永久性的左到右承诺确保单个错误词元会在整个输出序列中向前级联而无需修正。数据集病态——长尾缺陷、训练偏差和合成污染——放大了这些脆弱性,但并非独立导致它们。我们做出了三项贡献。首先,我们将每种机制映射到Alansari和Luqman分类法中的特定输出类别,将内在幻觉定位于自注意力,外在幻觉定位于MLE,逻辑不一致定位于自回归解码。其次,我们表明,每个常被引用的数据集病态都利用了这些机制之一,而非独立产生幻觉。第三,我们识别出仅按输出类型分类的诊断局限性,并将其与推理层缓解方法进行对比。
查看缓存全文
缓存时间: 2026/06/11 13:52
# 从架构到输出:大型语言模型幻觉的结构性起源及数据放大作用 来源:https://arxiv.org/html/2606.07537 ###### 摘要 大型语言模型会产生幻觉——输出流畅、自信但事实错误的内容——这种现象在代际和规模间持续存在。现有分类法按输出类型对幻觉进行分类,区分内在性失败与外在性失败,以及忠实性偏差与事实性偏差。这些框架在描述上严谨,但未能识别产生特定实例的内部机制。本文分析幻觉作为三个架构决策的结构性后果,它们共同构成一个复合失效系统。自注意力的共现学习用统计邻近性替代语义含义,导致实体混淆、事实错误归因和语义漂移。最大似然估计训练目标在无事实约束下优化下一个词符概率,奖励统计上合理的输出,无论其真值如何。自回归解码在暴露偏差下的永久从左到右承诺确保单次错误词符会级联传播至整个输出序列,且无法修正。数据集病态——长尾缺陷、训练偏差和合成污染——放大了这些脆弱性,但并不独立导致它们。我们做出三项贡献。首先,我们将每种机制映射到 Alansari 和 Luqman 分类法中的特定输出类别,将内在幻觉定位于自注意力,外在幻觉定位于 MLE,逻辑不一致定位于自回归解码。其次,我们表明每个常被引用的数据集病态利用了这些机制之一,而非独立产生幻觉。第三,我们识别出仅按输出类型分类的诊断局限性,并将其与推理层缓解方法进行对比。 大型语言模型以任何规模缩放都未能解决的持续性,产生流畅、自信但事实错误的输出。这种失败——幻觉——已在不同模型代际中被记录,在基准测试中被测量,并在综述中被分类。Alansari 和 Luqman[1 (https://arxiv.org/html/2606.07537#bib.bib1)] 提供了最近最全面的论述之一,根据输出与输入上下文及外部可验证事实的关系,将幻觉输出分类为内在或外在。Huang 等人[2 (https://arxiv.org/html/2606.07537#bib.bib2)] 在忠实性和事实性失败之间做了平行区分。两个框架在分析上都很严谨。但两者共享相同的结构性局限:它们描述了发生的是哪种幻觉,而没有识别是哪个内部机制产生了它。 本文认为这种描述是不够的。幻觉并非随输出随机变化的表面现象,而是特定架构决策的结构性后果——这些决策创造了错误产生的条件,无论数据集质量、模型规模或推理策略如何。在该领域能识别出特定幻觉实例是由哪个架构机制负责之前,干预将必然间接:管理输出而非解决根源。 本文确立的三个机制构成了结构性起源。第一个是 Vaswani 等人[3 (https://arxiv.org/html/2606.07537#bib.bib3)] 引入的自注意力,它根据训练数据中的统计共现模式而非因果或语义真实情况计算词符关系。该机制学习哪些词往往共现,并在所有上下文中应用这一学习——包括所学关联并不成立的情况。第二个是 Brown 等人[4 (https://arxiv.org/html/2606.07537#bib.bib4)] 大规模记录的最大似然估计训练目标,它训练模型最大化训练语料库中下一个词符的概率,而不对事实准确性施加任何约束。统计合理性得到奖励,而真相并非目标。第三个是自回归解码,其结构性脆弱性——暴露偏差——由 Ranzato 等人[5 (https://arxiv.org/html/2606.07537#bib.bib5)] 发现:模型在每一步都基于真实词符进行训练,从未遇到自己的错误,因此在推理中一旦产生错误词符,模型便没有结构上的准备来恢复。该错误词符成为所有后续预测的输入。随之而来的级联是解码架构的特性,而非数据的特性。 这三个机制并非独立运作。它们构成一个复合失效系统。数据集病态——长尾缺陷、训练偏差、来自先前模型生成的合成污染——并不独立导致幻觉。它们利用架构已有的脆弱性,放大了机制在结构上所能产生的故障频率和严重性。 基于这一结构性分析,我们做出三项贡献。首先,我们在三个架构机制与 Alansari 和 Luqman[1 (https://arxiv.org/html/2606.07537#bib.bib1)] 分类法中的输出类别之间建立映射,将内在幻觉定位于自注意力的共现学习,外在幻觉定位于 MLE 目标,逻辑不一致定位于自回归解码。其次,我们表明三个常被引用的数据集病态——长尾缺陷、训练偏差和合成污染——各自利用特定的架构机制,而非独立产生幻觉。第三,我们识别出仅按输出类型分类幻觉所带来的诊断局限,并将其与推理层缓解方法(如 Self-Refine[6 (https://arxiv.org/html/2606.07537#bib.bib6)] 和思维链提示[7 (https://arxiv.org/html/2606.07537#bib.bib7)] 进行对比。 本文结构如下。第一节回顾了先前的幻觉综述并识别其共同的诊断局限。第二节介绍作为复合失效系统的三个架构机制。第三、四、五节分别详细分析每个机制——自注意力扩散、自回归级联和 MLE 目标。第六节在受控提示下对 GPT-2 进行实验验证每个机制。第七、八、九节阐述数据集病态如何放大每个机制而不独立导致幻觉。第十节分析架构机制与分类类别之间的映射,并讨论仅按输出类型分类的诊断局限。第十一节进行总结并指出局限性和未来工作方向。 ## I 先前的幻觉综述及其共同局限 关于大型语言模型幻觉的研究已产生了日益丰富的分类工作。Alansari 和 Luqman[1 (https://arxiv.org/html/2606.07537#bib.bib1)] 提供了最近最全面的综述之一,将幻觉输出分类为内在——模型与输入上下文中的信息相矛盾——或外在——输出无法通过任何外部真相来源验证。Huang 等人[2 (https://arxiv.org/html/2606.07537#bib.bib2)] 在忠实性和事实性之间做了平行区分,识别模型输出与来源材料分歧之处以及与已确立事实分歧之处。两个框架都很有价值。但两者共享相同的结构性局限。 这些分类法描述了发生的是哪种幻觉,而没有识别是哪个内部机制产生了它。一个综述可以精确地将输出分类为外在幻觉,但仍然完全悬置哪个架构决策使该输出成为可能的问题。分类告诉你症状,但没有定位原因。 这不是一个小缺口。无法识别错误来源的分类法无法指导有针对性的干预。一个能识别失败部位(而不仅仅是其可见的输出特征)的诊断框架,能够针对机制而非症状进行干预。先前的综述已对幻觉作为输出现象进行了严谨的描述。但结构性问题的研究尚不充分:哪些架构机制首先构成了幻觉产生的必要条件?这正是本文要解决的问题。 ## II 架构机制:一个复合失效系统 基于 Transformer 的大型语言模型建立在三个架构决策之上,它们共同构成了幻觉的结构性起源。每个决策都隐含了关于语言和意义之间关系的假设。每个假设在特定条件下都会失效。每个失败都会产生一个独特且可识别的幻觉输出类型。 第一个机制是自注意力。Vaswani 等人[3 (https://arxiv.org/html/2606.07537#bib.bib3)] 引入注意力机制作为对输入序列中词符之间关系进行加权的方法。在实践中,该机制从训练语料库中的统计共现模式学习这些关系——频繁同时出现的词符会形成较强的关联权重。隐含的假设是统计邻近性近似于语义关系。但事实并非如此。当两个词符因共现而强关联,但其关系在新上下文中不成立时,模型会不加区别地应用所学关联。Liu 等人[8 (https://arxiv.org/html/2606.07537#bib.bib8)] 通过实验证明,这种位置和分布偏差会产生可衡量的失败——模型在长上下文中间出现相关信息时会丢失注意力,转而关注位置边缘。注意力并非为理解含义而阅读,而是为模式而阅读。这一结构性属性是实体混淆、事实错误归因和语义漂移的根源。 第二个机制是最大似然估计训练目标。Brown 等人[4 (https://arxiv.org/html/2606.07537#bib.bib4)] 记录了大规模语言模型训练目标是最大化给定前文上下文的下一个词符概率——在整个训练语料库上,而不施加事实约束。隐含的假设是统计上合理的输出就是令人满意的输出。但事实并非如此。Lin 等人[9 (https://arxiv.org/html/2606.07537#bib.bib9)] 直接测量了这一后果:在 MLE 下训练的更大模型并不会更真实,反而更不真实。随着模型更好地学习训练分布,它也会更好地复现其中的虚假信息。语料库中高频率的虚假模式比低频率的真实模式学习得更有信心。MLE 不区分两者。流畅性得到优化,而真相从来不是目标。 第三个机制是自回归解码。从左到右的词符生成过程永久性地承诺每个生成的词符,然后该词符作为所有后续词符的输入上下文。Ranzato 等人[5 (https://arxiv.org/html/2606.07537#bib.bib5)] 识别了由此产生的结构性脆弱性——暴露偏差。训练时,模型在每一步都接收正确的真实词符,从未遇到自己的错误。推理时,模型必须消耗自己的输出。一旦生成了错误词符,该词符就成为之后一切的方向性上下文。模型从未被训练来从这种情况中恢复。一个提交的错误不会孤立存在——它会向前传播并累积,产生内部连贯但从第一个错误点起事实断裂的输出。 这三个机制并非独立运作。它们构成一个复合失效系统,如图1 (https://arxiv.org/html/2606.07537#S2.F1) 和图2 (https://arxiv.org/html/2606.07537#S2.F2) 所示。注意力产生错误的关联上下文。MLE 训练模型复现统计上频繁的模式,无论其真假如何。自回归解码确保一旦提交了错误模式,整个后续输出都跟随它。数据集病态并不创造这个系统——它们利用它。这种因果结构是本文的核心论点。 参见图注 图1:架构因果链。每个架构机制映射到特定的幻觉类型:自注意力对应内在幻觉,MLE 对应外在幻觉,自回归解码对应逻辑不一致。三者汇聚产生流畅、自信但事实错误的输出。数据集病态(第七至九节)放大每个机制,但不独立产生幻觉。 参见图注 图2:复合失效系统。三个架构机制及其数学公式和特定失效模式显示。自注意力触发错误关联(→内在幻觉),MLE 同等奖励虚假与真实(→外在幻觉),自回归解码级联第一个错误词符(→逻辑不一致)。数据集放大层显示每个病态如何利用特定机制而不独立导致幻觉。 ## III 自注意力扩散作为结构性幻觉起源 大型语言模型中负责幻觉的第一个架构机制是 Vaswani 等人[3 (https://arxiv.org/html/2606.07537#bib.bib3)] 引入的自注意力机制。要理解为什么注意力会在结构上产生幻觉,必须准确理解它学到了什么——以及没学到什么。 自注意力机制的计算公式为: Attention(Q,K,V)=softmax(QK⊤/√d_k)V (1) 其中 Q、K、V 分别表示查询、键和值矩阵,d_k 是作为缩放因子的键维度。乘积 QK⊤ 编码了词符对之间的共现强度。该公式中没有任何事实约束。Vaswani 等人[3 (https://arxiv.org/html/2606.07537#bib.bib3)] 指定的完整多头形式将其扩展为 h 个并行注意力头: MultiHead(Q,K,V)=Concat(head_1,...,head_h)W^O (2) 其中每个 head_i=Attention(QW_i^Q, KW_i^K, VW_i^V)。多个头允许模型同时关注不同的共现模式,通过 h 个并行过程[3 (https://arxiv.org/html/2606.07537#bib.bib3),10 (https://arxiv.org/html/2606.07537#bib.bib10)] 复合了结构性脆弱性。 自注意力通过计算序列中每个词符与所有其他词符之间的加权关系来运作。这些权重并非来自语义理解,而是来自训练语料库中学习到的统计共现模式。一个在训练中经常出现在另一个词符附近的词符会与其形成较强的关联权重。该机制没有访问因果结构的途径,没有真实世界关系的表示,也没有能力评估所学关联是否在上下文中有效。它学习哪些词往往共现,并在所有地方应用这一学习。
相似文章
HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉
北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。
幻觉作为轨迹承诺:Transformer生成中非对称吸引子动力学的因果证据
本文提供因果证据表明自回归语言模型中的幻觉源于由非对称吸引子动力学驱动的早期轨迹承诺。通过在Qwen2.5-1.5B上进行同提示分叉和激活补丁实验,证明幻觉轨迹在首个token处分叉,并在模型各层间展现强烈的因果非对称性。
使用分流解码的大语言模型幻觉检测
本文提出分流解码(diversion decoding)方法,通过在解码阶段主动挑战模型响应来提取特征,训练不确定性启发式模型,从而检测大语言模型中的幻觉,实现了更优的性能和更低的计算复杂度。
幻觉作为承诺失败:大型语言模型在知晓答案的情况下仍然犯错
本文研究了大型语言模型在其生成时间分布中已有正确答案时仍产生幻觉的现象。通过引入答案可用性的语义概念,作者表明16-47%的指令调优模型幻觉发生在正确概念已经表示的情况下,并且这一比例随着模型规模增加而上升。他们指出,指令调优强化了答案承诺,使得有用性和自信幻觉成为同一枚硬币的两面。
为什么语言模型会产生幻觉
OpenAI发布研究指出,语言模型产生幻觉的原因在于标准的训练和评估程序奖励猜测而不是承认不确定性,并建议评估指标应该优先考虑对局限性的诚实认识而不是原始准确率。