上下文归因如何处理模型已知的知识

arXiv cs.CL 论文

摘要

本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。

arXiv:2607.23804v1 公告类型:新 摘要:大型语言模型(LLM)的上下文归因方法用于识别哪些输入上下文对模型响应有贡献。近期研究展示了这些方法在归因上下文贡献分数方面的初步成功。然而,我们观察到,当上下文与训练数据重叠时,这些方法无法区分上下文内贡献与权重内(IW)贡献,从而产生不可靠的分数。基于这一观察,本文提出了:1)一个依赖四个新指标(基础模型上下文归因分数(BCS)、跨模型上下文归因一致性(CAC)、归因保留分数(APS)、源分离精度(SSP))的评估协议,以及2)一个带有真实来源标签的基准数据集(WMDP-Cyber++),用于系统评估IW重叠情况下的归因性能。在针对四种知名上下文归因方法的实验中,我们证明了当上下文中的知识也存在于权重中时,它们会提供不准确的归因。最后,我们将这些方法应用于源分离(IW与上下文学习(ICL)),并表明它们无法基于贡献分数进行有效的解缠。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:30

# 上下文归因如何处理模型已知信息
来源:https://arxiv.org/abs/2607.23804
查看 PDF (https://arxiv.org/pdf/2607.23804)

> 摘要:大型语言模型(LLM)的上下文归因方法用于识别哪些输入上下文对模型响应有贡献。近期研究初步展示了上下文归因分数的有效性。然而,我们观察到,当上下文与训练数据重叠时,这些方法无法将上下文内贡献与权重内(IW)贡献解耦,从而产生不可靠的分数。基于这一发现,本文引入:1)一套评估协议,包含四个新指标(基础模型上下文归因分数 BCS、跨模型上下文归因一致性 CAC、归因保留分数 APS、源分离精度 SSP);2)一个带有真实来源标签的基准数据集(WMDP-Cyber++),用于在 IW 重叠情况下系统评估归因效果。在四种知名上下文归因方法的实验中,我们证明了当上下文中的知识也存在于权重中时,这些方法会提供不忠实的归因。最后,我们将这些方法适配于源分离(IW 与上下文学习 ICL),并证明它们无法基于贡献分数实现解耦。

## 提交历史

来自:Quoc-Huy Trinh [查看邮箱](https://arxiv.org/show-email/313d2102/2607.23804) **[v1]** 2026年7月26日 星期日 19:06:29 UTC (603 KB)

相似文章

长上下文LLM中的位置失败:推理基准测试的盲点

arXiv cs.CL

本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。

Context Is Not Control:面向LLM的源边界评估

Reddit r/LocalLLaMA

一篇介绍《Context Is Not Control》的论文,该基准评估LLM在处理受控文本中介证据时的源边界失效问题。附带开放权重模型和前沿API模型的复现包。