上下文归因如何处理模型已知的知识
摘要
本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。
arXiv:2607.23804v1 公告类型:新
摘要:大型语言模型(LLM)的上下文归因方法用于识别哪些输入上下文对模型响应有贡献。近期研究展示了这些方法在归因上下文贡献分数方面的初步成功。然而,我们观察到,当上下文与训练数据重叠时,这些方法无法区分上下文内贡献与权重内(IW)贡献,从而产生不可靠的分数。基于这一观察,本文提出了:1)一个依赖四个新指标(基础模型上下文归因分数(BCS)、跨模型上下文归因一致性(CAC)、归因保留分数(APS)、源分离精度(SSP))的评估协议,以及2)一个带有真实来源标签的基准数据集(WMDP-Cyber++),用于系统评估IW重叠情况下的归因性能。在针对四种知名上下文归因方法的实验中,我们证明了当上下文中的知识也存在于权重中时,它们会提供不准确的归因。最后,我们将这些方法应用于源分离(IW与上下文学习(ICL)),并表明它们无法基于贡献分数进行有效的解缠。
查看缓存全文
缓存时间: 2026/07/28 06:30
# 上下文归因如何处理模型已知信息 来源:https://arxiv.org/abs/2607.23804 查看 PDF (https://arxiv.org/pdf/2607.23804) > 摘要:大型语言模型(LLM)的上下文归因方法用于识别哪些输入上下文对模型响应有贡献。近期研究初步展示了上下文归因分数的有效性。然而,我们观察到,当上下文与训练数据重叠时,这些方法无法将上下文内贡献与权重内(IW)贡献解耦,从而产生不可靠的分数。基于这一发现,本文引入:1)一套评估协议,包含四个新指标(基础模型上下文归因分数 BCS、跨模型上下文归因一致性 CAC、归因保留分数 APS、源分离精度 SSP);2)一个带有真实来源标签的基准数据集(WMDP-Cyber++),用于在 IW 重叠情况下系统评估归因效果。在四种知名上下文归因方法的实验中,我们证明了当上下文中的知识也存在于权重中时,这些方法会提供不忠实的归因。最后,我们将这些方法适配于源分离(IW 与上下文学习 ICL),并证明它们无法基于贡献分数实现解耦。 ## 提交历史 来自:Quoc-Huy Trinh [查看邮箱](https://arxiv.org/show-email/313d2102/2607.23804) **[v1]** 2026年7月26日 星期日 19:06:29 UTC (603 KB)
相似文章
真实场景下的对比归因:针对现实基准中大模型失效的可解释性分析
研究者采用基于LRP的对比归因方法,分析大模型在现实基准中失败的原因,发现该方法在某些场景下能提供有用信号,但并非始终可靠。
长上下文LLM中的位置失败:推理基准测试的盲点
本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。
当上下文误导时:大型语言模型中的 Jurisdiction 上下文学习
本文介绍了 FakeContext-bench,用于评估大型语言模型区分上下文信息和事实知识的能力,并提出了 Jurisdiction In-Context Learning (J-ICL) 以增强上下文学习性能和对误导性上下文的抵抗力。
大语言模型在解决上下文知识冲突中的作用
本文介绍了大语言模型中上下文知识冲突的分类体系和数据集,并对七种LLM进行了实验,提出了一种引导方法,以提高推理和摘要任务中的冲突解决能力。
Context Is Not Control:面向LLM的源边界评估
一篇介绍《Context Is Not Control》的论文,该基准评估LLM在处理受控文本中介证据时的源边界失效问题。附带开放权重模型和前沿API模型的复现包。