大语言模型在解决上下文知识冲突中的作用
摘要
本文介绍了大语言模型中上下文知识冲突的分类体系和数据集,并对七种LLM进行了实验,提出了一种引导方法,以提高推理和摘要任务中的冲突解决能力。
arXiv:2609.03148v1 Announce Type: new
摘要:大多数先前的研究关注于大语言模型内部参数知识与外部提供的上下文之间的冲突。相比之下,我们研究了大语言模型如何处理上下文知识本身内部出现的冲突。我们引入了六种上下文冲突的分类体系(事实性、推理性、时间性、粒度、视角和模糊性),并为此设置贡献了一个全面的数据集ContextConflict。该数据集包含5,781个样本,涵盖推理和摘要任务,包括需要多步推理的显式矛盾和隐式冲突。对九种LLM的实验表明,当前模型在解决上下文知识冲突方面仍然不足。我们进一步提供了LLM处理此类冲突的机制可解释性见解,揭示了它们对冲突的潜在意识以及冲突处理的表示几何。此外,我们的分析揭示了模型对早期证据的一致偏差,这种位置偏好是有效冲突解决的关键障碍。基于这些发现,我们进一步提出了一种简单的无需训练、无需标签的引导方法,通过引导激活以鼓励更全面地纳入证据,从而改善冲突解决。在我们的数据集上,该方法在推理任务中始终提高准确性,并在摘要任务中生成更高质量、更平衡的摘要。
查看缓存全文
缓存时间: 2026/09/04 05:54
# 大型语言模型在解决上下文知识冲突中的作用 来源:https://arxiv.org/html/2609.03148 Xinye Yang Zhenyang Liu 单位:西北大学,埃文斯顿,伊利诺伊州 邮箱:[yuanyuan\.lei@ufl\.edu](mailto:[email protected]) Ruisi Li 单位:纽约大学,纽约州,纽约 Yuanyuan Lei 单位:计算机与信息科学与工程学院,佛罗里达大学,盖恩斯维尔,佛罗里达州 ###### 摘要 先前的大多数研究关注的是大型语言模型的内部参数知识与外部提供上下文之间的冲突。相比之下,我们研究了大型语言模型如何处理上下文知识内部产生的冲突。我们引入了一个包含六种上下文冲突类型的分类体系(错误信息、推理型、时间型、粒度型、视角型和歧义型),并为此场景贡献了一个全面的数据集ContextConflict。该数据集包含5,781个样本,涵盖推理和摘要任务,包括需要多步推理的显式矛盾和隐式冲突。在七个大型语言模型上的实验表明,当前模型在解决上下文知识冲突方面仍然表现不佳。我们进一步从机制可解释性的角度深入分析了大型语言模型如何处理此类冲突,揭示了其潜在的冲突意识以及冲突处理所依赖的表征几何结构。此外,我们的分析发现模型存在一致的偏向前序证据的偏见,这种位置偏好是有效解决冲突的关键障碍。基于这些发现,我们进一步提出了一种简单的、无需训练和标签的引导方法,该方法通过引导激活过程来鼓励更全面地整合证据,从而更好地解决冲突。在我们的数据集上,该方法持续提高了推理任务的准确率,并为摘要任务生成了质量更高、更平衡的摘要。111数据集和代码链接为:https://github.com/lei-nlp-lab/context_conflict_emnlp_2026。222ContextConflict数据集也已发布在Hugging Face:https://huggingface.co/datasets/AsherYang/ContextConflict ## 1 引言 部署在检索增强或多文档场景中的大型语言模型(LLMs)经常从多个来源遇到相互冲突的信息。图1 (https://arxiv.org/html/2609.03148#S1.F1)展示了一个典型案例:当被问及社交媒体的身份验证策略时,大型语言模型必须综合优先考虑不同价值观(安全与隐私)的对立观点。因此,下游应用的可靠性在很大程度上取决于模型处理此类冲突的能力。当冲突解决失败时,输出可能会产生幻觉、事实错误或片面内容Shi et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib9);Chen et al\. \(2022\) (https://arxiv.org/html/2609.03148#bib.bib4),这种失败模式延伸至新闻聚合、医疗决策支持、错误信息检测以及高风险场景下的法律推理等领域。因此,表征大型语言模型如何处理多源冲突是诊断和纠正这些失败的前提Longpre et al\. \(2021\) (https://arxiv.org/html/2609.03148#bib.bib1);Chen et al\. \(2022\) (https://arxiv.org/html/2609.03148#bib.bib4)。 参照标题 图 1:上下文知识冲突示例:两个上下文提供了不同的视角。 先前关于上下文知识冲突的数据集存在四个相互关联的局限性。首先,它们依赖于基于模板的合成构建,最常见的是实体替换,未能捕捉到现实世界的复杂性Su et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib10);Longpre et al\. \(2021\) (https://arxiv.org/html/2609.03148#bib.bib1)。其次,它们关注显式的事实矛盾,而忽略了需要多步推理的隐式冲突Su et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib10);Lazaridou et al\. \(2021\) (https://arxiv.org/html/2609.03148#bib.bib5);Du et al\. \(2022\) (https://arxiv.org/html/2609.03148#bib.bib6)。第三,它们提供的领域广度和冲突类型覆盖有限。第四,它们可能存在类别不平衡问题,这使得类别级别的分析在统计上不可靠Xu et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib7);Xie et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib13)。 为解决上述差距,我们贡献了ContextConflict,一个全面的多领域上下文知识冲突数据集,包含5,781个样本。我们定义了一个包含六种冲突类型的分类体系,包括错误信息、推理型、时间型、粒度型、视角型和歧义型冲突。前三种对应推理任务,要求大型语言模型执行推理并从多个冲突证据中识别正确答案。后三种对应摘要任务,期望大型语言模型生成保留不同视角的平衡摘要。在每种冲突类型内,我们进一步区分了可通过直接表面比较识别的显式冲突和需要多步跨证据推理才能解决的隐式冲突。在该数据集上对涵盖闭源和开源模型的七个大型语言模型进行的评估表明,现代大型语言模型在解决上下文知识冲突方面仍然表现不佳。我们还提供了关于大型语言模型如何处理上下文冲突的机制可解释性洞察。具体来说,我们使用概念激活向量Kim et al\. \(2018\) (https://arxiv.org/html/2609.03148#bib.bib11)和频谱能量分解Eckart and Young \(1936\) (https://arxiv.org/html/2609.03148#bib.bib37),分别研究了每种冲突类型的潜在意识和表征几何结构。我们还检查了在表征层面和输出层面的证据归因:在表征层面,我们比较了由单一证据与组合证据引起的激活几何结构;在输出层面,我们使用基于Shapley的归因分数Lundberg and Lee \(2017\) (https://arxiv.org/html/2609.03148#bib.bib38)量化了证据贡献。我们的分析揭示了模型内部对上下文冲突的强烈意识,不同的冲突类型在不同层深度显现,并在模型的潜在空间中呈现为不同的几何结构。我们还发现模型存在一致的偏向前序位置证据的偏见,表明这种位置偏好是全面整合证据的关键障碍。 为解决此问题,我们设计了一种无需训练和标签的引导方法,以减轻位置偏好并鼓励更全面地考虑冲突证据。具体来说,我们通过计算大型语言模型在处理每段证据时的激活质心来构建一个引导方向。在推理过程中,我们沿着这个引导方向轻微调整模型的激活,引导其更均匀地关注不同位置的证据,从而更全面地整合证据。结果表明,我们这个简单的方法有效地提升了大型语言模型解决知识冲突的能力,在摘要任务中生成了更平衡的摘要,在推理任务中获得了更高的准确率。 我们的主要贡献总结如下。 - • 我们贡献了一个全面的多领域数据集,涵盖六种类型的上下文知识冲突,跨越多个领域的推理和摘要任务。 - • 我们对上下文冲突处理进行了机制可解释性分析,揭示了每种冲突如何在大型语言模型中被检测、几何表示和处理。 - • 我们设计了一种无需训练和标签的引导方法,鼓励更全面地整合冲突证据,从而在冲突解决中取得更好的性能。 ## 2 ContextConflict:上下文知识冲突数据集 ### 2.1 概述 我们贡献了一个多领域上下文知识冲突数据集,以解决现有数据集的局限性。我们定义了一个包含六种冲突类型的分类体系,每种冲突类型探究一种不同的能力,包括推理型推理(对冲突前提的多步推理)、错误信息鲁棒性(对看似合理的错误信息的抵抗力)、时间型推理(跟踪主张随时间推移的有效性)、粒度对齐(调和不同抽象级别的信息)、视角整合(平衡不同的观点)以及歧义消解(消除跨文档的共指实体歧义)。这六种冲突类型可以组织成两个任务族:推理任务(推理型、错误信息型、时间型)要求模型在冲突证据下识别正确答案;摘要任务(歧义型、视角型、粒度型)要求模型生成保留不同观点的平衡摘要。在每个任务族内,冲突进一步分为显式和隐式案例。显式案例可通过直接表面比较检测,最多需要一步推理。隐式案例通过多步跨证据推理出现,至少需要两步推理。我们提供了每种类型的隐式比例,见表1 (https://arxiv.org/html/2609.03148#S2.T1)。 模型输出的期望因任务族而异。在推理任务中,每个实例都有一个可验证的 ground-truth 答案,因此期望模型在冲突证据下识别正确结论,评估指标为准确率(Accuracy)。在摘要任务中,每个实例允许多个有效响应:视角型和歧义型通常涉及不同的政治意见或社会问题,而粒度型允许在不同具体性水平上给出兼容的答案。期望模型全面整合不同观点,生成平衡的摘要:对于视角型冲突,应呈现并对比所有立场,不偏袒任何一方;对于歧义型冲突,应识别潜在的名称冲突并涵盖每个引用的实体;对于粒度型冲突,应整合不同具体性水平并说明其兼容性。基于Shapley的平衡分数(Shapley-based Balance score)被用作评估指标,以衡量证据使用的均匀性。更多评估细节见3.1 (https://arxiv.org/html/2609.03148#S3.SS1)。 表 1:ContextConflict统计信息:每种冲突类型的样本大小、平均证据数量、隐式冲突比例和基础来源。 ### 2.2 数据集构成 我们从十个涵盖不同领域的基础数据集构建数据集;附录表5 (https://arxiv.org/html/2609.03148#A2.T5)列出了每个来源及其领域、许可证和每种冲突类型的使用情况。该数据集包含1,734个半合成实例(29.99%)和4,047个保留原始数据并由人工按冲突类型分类的实例(70.01%),总计5,781个。不同于先前的合成冲突数据集通过实体替换来构建冲突Su et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib10);Longpre et al\. \(2021\) (https://arxiv.org/html/2609.03148#bib.bib1)(这保持周围上下文不变,仅替换实体,产生浅层的词汇矛盾),我们的半合成实例仅使用GPT-5Singh et al\. \(2025\) (https://arxiv.org/html/2609.03148#bib.bib3)作为生成冲突证据或时间戳的辅助工具;黄金标签继承自源数据集或由人工重新标注,绝非由GPT-5生成。这既保留了冲突证据的语篇连贯性,又保持了标签完整性独立于生成器。质量保证与风险成比例,根据每个构建步骤可能破坏标签的程度进行调整。其扰动可能翻转黄金标签的子集由两名独立标注员进行全面重新标注;其增强很少改变标签的子集在30%的样本上进行审计;保留原始数据的子集按10%进行抽查。每个来源的来源计数在元数据中发布;附录B.1 (https://arxiv.org/html/2609.03148#A2.SS1)报告了完整的GPT-5提示和验证规则,附录B.3 (https://arxiv.org/html/2609.03148#A2.SS3)提供了代表性样本。 ##### 粒度型和推理型冲突。 NEJM-MedQASavage et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib25)结合了美国医学执照考试题目和来自《新英格兰医学杂志》的真实临床案例。每个实例提供临床证据(症状、实验室结果、病史)和几个候选推理链。每个链是根据源数据集中的不同诊断推理提示策略生成的,并带有一个由临床医生裁定的二元黄金正确性标志。我们选择两个链在最终诊断上不一致的案例。当两个诊断都是黄金正确的但处于不同抽象级别(例如,一个广泛的综合征标签与其包含的特定病原体)时,我们将其标记为粒度型冲突:两个答案是兼容的,仅在诊断特异性上有所不同。当只有一个诊断是黄金正确的,而另一个通过有缺陷的中间步骤(例如,错误应用的临床启发式方法)得出错误结论时,我们将其标记为推理型冲突:分歧存在于推理过程层面。原始问题和推理链作为证据被保留。 ##### 推理型冲突。 FOLIOHan et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib26)和ENTAILMENTBANKDalvi et al\. \(2021\) (https://arxiv.org/html/2609.03148#bib.bib24)是逻辑推理数据集。每个实例给出一组前提和一个假设,标注前提是否蕴含假设、与假设矛盾或对假设保持中立。我们添加一个或两个额外的陈述来扰动原始推理链。因为添加的证据可能改变标签有效性,所以每个生成的实例都由两名独立标注员重新标注,分歧通过讨论解决(100%双标注覆盖;标注界面见附录图8 (https://arxiv.org/html/2609.03148#A2.F8))。 ##### 错误信息型冲突。 SciFactWadden et al\. \(2020\) (https://arxiv.org/html/2609.03148#bib.bib29)是一个事实核查数据集。每个实例将一个主张与来自研究摘要的证据句子配对,标注为支持或反驳该主张。我们以匹配的写作风格(包括实验风格的引用)生成冲突证据,以构建错误信息型冲突。因为这种增强很少改变黄金标签,我们对30%的样本进行了风格和论证一致性的审计。 ##### 时间型冲突。 ConflictBank-temporalSu et al\. \(2024\) (https://arxiv.org/html/2609.03148#bib.bib10)实例包含具有隐含时间顺序的证据陈述和一个时间敏感的问题。我们在不修改原始证据的情况下,为每个陈述附加一个明确的时间戳,使时间关系变得明确。因为时间戳可能改变黄金标签,所以每个实例都由两名独立标注员通过基于讨论的裁定进行验证。 ##### 其余数据集的整理。 对于未使用合成生成的数据集(AmbigDocs, ROAST-ABSA, AllSides, Perspectrum, CONFLICTS),我们随机抽取每个来源的10%进行质量审查和冲突类别验证。 ## 3 评估 ### 3.1 评估指标 我们使用与任务重点相辅相成的指标来评估模型性能。 准确率。对于推理任务(推理型、错误信息型和时间型冲突),我们衡量模型输出与黄金标准标签匹配的比例。 证据平衡。对于摘要任务,尽管它们的...
相似文章
从上下文感知到冲突感知:将对比解码推广到LLM中的知识冲突
该论文将对比解码推广到一种冲突感知范式,该范式在外部上下文和参数先验之间动态分配权威,提出了TriState-Bench评估协议,并引入了自适应机制路由(ARR)来解决修正与抵抗之间的不对称性。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
LLM蕴含多样性:部署环境如何重塑模型层面的偏好与价值观
本文探讨大型语言模型在不同部署环境中是否具有稳定的偏好,发现环境变化引起的差异远大于提示扰动,表明测得的偏好是环境条件决定的而非固定属性。
上下文-参数冲突的三种机制:预测框架与实证验证
本文提出了一个三机制框架,以解决大型语言模型(LLM)在处理训练知识与新文档之间冲突时出现的实证矛盾,并在五大主流模型上进行了验证。该框架区分了参数强度与参数唯一性,并展示了任务框架和证据连贯性如何显著影响模型行为。
上下文归因如何处理模型已知的知识
本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。