追踪大语言模型中的关系知识回忆
摘要
研究者通过探测每个注意力头的贡献,追踪大语言模型如何回忆关系事实,发现这些贡献是强线性特征,其保真度与关系特异性及实体连接度相关。
arXiv:2604.19934v1 公告类型: new
摘要:我们研究大语言模型在文本生成过程中如何回忆关系知识,重点识别可用于线性探针关系分类的潜在表征。先前工作揭示了注意力头与 MLP 如何协同解析主语、谓语和宾语,但尚不清楚哪些表征能可靠地支持线性关系分类,以及为何某些关系类型更易被线性捕获。我们系统评估来自注意力头和 MLP 贡献的不同潜在表征,发现每个注意力头对残差流的贡献是相对更强的线性关系分类特征。对训练后探针的特征归因分析,以及不同关系类型的特性,显示出探针准确率与关系特异性、实体连接度、以及探针所依赖信号在注意力头间的分布程度之间存在显著相关性。最后,我们展示如何利用探针预测的 token 级特征归因,进一步揭示探针行为细节。
查看缓存全文
缓存时间: 2026/04/23 10:03
# 追踪大语言模型中的关系知识召回
来源:https://arxiv.org/html/2604.19934
Michael Färber,德国德累斯顿工业大学 & ScaDS.AI 德累斯顿/莱比锡
{nicholas.popovic,michael.faerber}@tu-dresden.de
###### 摘要
我们研究大语言模型(LLM)在文本生成过程中如何召回关系知识,重点寻找可用于线性探针进行关系分类的潜在表征。已有工作揭示了注意力头与 MLP 如何协同解析主语、谓语和宾语,但尚不清楚哪些表征能可靠地支持线性关系分类,以及为何某些关系类型更容易被线性捕获。我们系统评估了来自注意力头和 MLP 的不同潜在表征,发现“每个注意力头对残差流的贡献”是线性关系分类的强特征。对训练后探针的特征归因分析,以及不同关系类型的特性,显示探针准确率与关系特异性、实体连通度、以及探针依赖的信号在注意力头间的分布程度存在显著相关。最后,我们利用词元级特征归因进一步揭示探针行为。代码已开源:https://nicpopovic.com/publications/tracing。
追踪大语言模型中的关系知识召回
Nicholas Popovič 和 Michael Färber
德国德累斯顿工业大学 & ScaDS.AI 德累斯顿/莱比锡
{nicholas.popovic,michael.faerber}@tu-dresden.de
## 1 引言
图 1:注意力头贡献探针与词元级特征归因示意图,展示影响探针预测的最关键词元。
理解 LLM 存储与召回关系知识的确切机制是可解释性研究的核心。分析“给定主语和谓语生成正确宾语”时的信息流动,已显著深化我们对 LLM 知识表征的认识(如 Meng et al. 2022;Geva et al. 2023;Hernandez et al. 2024)。
最新研究指出:
1. 在主体词元跨度的最后一个位置,中后层表征累积了**主体实体**信息(Meng et al. 2022;Geva et al. 2023;Popovic and Färber 2024;Sakata et al. 2025)。
2. 通过注意力头,**谓语/关系**信息在前层、宾语生成前一位置被聚合(Geva et al. 2023;Li et al. 2024;Lv et al. 2024;Yu et al. 2025)。
3. 正确的**宾语实体**通过注意力从多个先前词元位置的 MLP 子层检索(Meng et al. 2022;Geva et al. 2023;Li et al. 2024;Yu and Ananiadou 2024),该过程有时可被线性近似(Hernandez et al. 2024),并追溯到关系特异性神经元(Liu et al. 2025)。后续工作进一步表明,召回分布式地跨越主语、关系和尾词位置,多个加性机制共同作用(Chughtai et al. 2024;Yu et al. 2025)。此外,实体表征足够可靠,可在生成过程中完成命名实体识别(Popovic and Färber 2024;Morand et al. 2025)与实体消歧(Sakata et al. 2025)。
本文旨在探究:哪些内部表征可在生成过程中可靠地进行关系分类?何时探针才能忠实反映模型知识?与易于定位的实体表征不同,可回溯到具体源词元的关系特征尚未被分离。我们系统比较来自注意力与 MLP 的候选表征,并分析探针本身及关系类型的属性,以预测探针性能。核心研究问题:
(i) 在 LLM 中应探测哪些潜在表征进行关系分类?
(ii) 何种关系属性与探针属性预示探测成功?
贡献如下:
1. 证明“逐头注意力贡献特征”是跨 4 个指令微调 LLM 进行小样本关系分类的强可解释基底。
2. 提出 HeadScore 与 TokenScore 两种探针侧归因方法,将线性探针的预测分解到注意力头与源词元。
3. 结合数据集/关系级统计量,发现线性探针性能的相关因素:关系层面——谓语输出范围、实体平均连通度、示例词汇相似度;探针层面——信号在注意力头间的集中程度。后者是训练后探针的属性,可作为免数据诊断指标。
4. 利用 TokenScore 检验探针是否依赖词汇捷径,仅少数错误与此一致,表明线性关系探针并非主要受词汇驱动。
我们在 LLaMA3(Dubey et al. 2024)与 Qwen3(Yang et al. 2025)两大家族、1B–8B 参数的 4 个指令微调模型上验证了上述发现。
## 2 相关工作
### 2.1 LLM 知识召回机制
大量研究致力于定位 LLM 存储与检索事实/关系知识的具体组件(Meng et al. 2022;Geva et al. 2023;Li et al. 2024;Lv et al. 2024)。主流观点认为:主体信息在主体末词累积,关系信息经注意力传至后位,宾语信息通过注意力从 MLP 检索。最新工作指出,事实召回由多个独立且加性的机制驱动(Chughtai et al. 2024;Yu et al. 2025)。对某些关系,该过程可被线性变换近似(Hernandez et al. 2024),但尚无非经验指标区分“可线性”与“不可线性”关系。我们发现:关系特异性(以谓语输出范围近似)可预测探针性能及关系特征在单头中的集中度。
此外,关系特异性神经元多出现在 MLP 层(Liu et al. 2025);注意力头则负责信息路由(Geva et al. 2023;Lv et al. 2024;Chughtai et al. 2024)。尽管许多注意力头承担不同语义/句法角色(Zheng et al. 2025),但尚未有研究在生成过程中用探针将关系信号回溯至具体源词元。我们采用“逐头、逐词元注意力贡献”作为探针特征,实现预测溯源。
### 2.2 从内部表征抽取信息
近期工作利用 LLM 内部表征在生成过程中做信息抽取。Popovic and Färber (2024) 用轻量探针在中间状态完成流式 NER;Morand et al. (2025) 进一步提升效率与鲁棒性。关系分类更具挑战:现有研究未提供在生成时同时向注意力头与源词元溯源的探针机制。我们首次结合头级与词元级归因,实现这一目标。
### 2.3 训练探针的归因方法
我们提出的 HeadScore 与 TokenScore 与线性归因/探针文献(Alain & Bengio 2017)密切相关,概念上类似梯度归因(Sundararajan et al. 2017)及词元加性贡献(Murdoch et al. 2018)。最接近的是 Chughtai et al. (2024),他们将注意力输出按源词元分解以研究模型自身的事实召回。TokenScore 把同类思想用于任务特定探针,解释探针决策而非模型的下一词元预测。
## 3 追踪关系知识召回
本节定义待探测的内部特征。尽管注意力与 MLP 被确认携带关系信号,但其如何按源词元分解仍不清楚。我们聚焦注意力头,定义基于贡献的特征。附录 B 图 7 给出探测位置示意图。3.3 节描述如何定位召回具体关系知识的最相关词元。
### 3.1 注意力特征
#### 记号
令 V_h(j) 表示注意力头 h 在源位置 j 产生的值向量,Attn_h(t,j) 为头 h 从目标位置 t 到 j 的 softmax 注意力权重,W_{O,h} 为对应输出投影矩阵。e₁ 与 e₂ 分别表示文本中先提及与后提及的实体跨度(孰为主/宾取决于语序)。Δ 表示在固定目标位置 t(即关系知识召回位置,通常位于第二个实体 e₂ 生成前一词元)对注意力残差流的贡献。
#### 1. 逐头注意力贡献 Δ_att,h(t)
Δ_att,h(t)=W_{O,h}(∑_j Attn_h(t,j)V_h(j)),即头 h 聚合所有源位置信息后对该时刻残差流的贡献。
#### 2. 逐头对特定源词元的贡献 Δ_att,h(t,j)
Δ_att,h(t,j)=W_{O,h}(Attn_h(t,j)V_h(j))。我们主要关心第一个实体 e₁ 的末词贡献,简记为 Δ_att,e₁,h ≜ Δ_att,h(t,j_{e₁})。相似文章
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。
语言模型中基于单元的关系绑定表示
研究表明,大型语言模型通过“基于单元的绑定表示”(CBR)对篇章级关系绑定进行编码:一种低维线性子空间,每个“单元”对应实体-关系索引对,为模型如何追踪实体与关系提供了因果证据。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
使用大型语言模型标注实体匹配的训练数据
本文研究使用大型语言模型作为教师模型来标注实体匹配的训练数据,结果表明,在机器标注数据上训练的学生模型与在人工标注基准上训练的模型性能相当,并且具有显著的成本和速度优势。
多模态大语言模型内部视觉表征的因果探针
本文提出了一种用于探测多模态大语言模型内部视觉表征的因果框架,揭示了实体与抽象概念在编码方式上的差异。研究强调增加模型深度对于编码抽象概念至关重要,并揭示了当前多模态大语言模型在感知与推理之间的脱节。