从机制上理解大语言模型微调中记忆知识无法泛化的原因

arXiv cs.AI 论文

摘要

本文形式化了大语言模型微调中的“知道-使用鸿沟”,即模型记忆事实但无法泛化。引入了自修补干预方法,并确定知识回路错位为根本原因,通过简单启发式方法恢复了58-75%的泛化失败。

arXiv:2607.08393v1 公告类型:新 摘要:微调大语言模型以注入新知识面临一个关键挑战:大语言模型可以快速记忆新事实,但无法将其用于下游推理任务。我们将这种失败形式化为\textit{\textbf{知道-使用鸿沟}},其特征在于记忆与泛化之间的准确率差距和时间延迟。为了理解这一现象,我们使用一种称为自修补的新干预技术,对未知知识进行微调,并监测知识内部的空间渗透动态。自修补确定了激活位置,在这些位置重新定位表示可以显著改善失败的泛化情况。这些结果与知识回路错位假说一致:记忆的表示可以存在于内部,但可能未被路由到计算有效的层。为了证明这一诊断发现的实用性,我们设计了一种简单的启发式策略,恢复了泛化失败中58-75%的oracle headroom。实验在跨领域进行,以验证这一发现的鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:08

# 迈向机制性理解:为何大语言模型微调中记忆的知识无法泛化
来源:https://arxiv.org/html/2607.08393
Lu Dai²,¹ Ziyang Rao¹ Yili Wang¹ Hanqing Wang¹ Hao Liu¹,² Hui Xiong¹,²
¹香港科技大学(广州)²香港科技大学
[email protected] {liuh,xionghui}@ust.hk

###### 摘要

微调大语言模型(LLMs)以注入新知识面临一个关键挑战:LLMs能快速记忆新事实,却无法在后续推理任务中使用它们。我们将这一失败形式化为“记忆-使用差距”(Knowing–Using Gap),其特征为准确率差距以及记忆与泛化之间的时间滞后。为理解这一现象,我们通过微调LLMs引入未知知识,并利用一种名为self-patching的新型干预技术,内部监测知识在空间上的渗透动态。Self-patching识别出某些激活位置,在这些位置重新定位表示能显著改善失败的泛化案例。这些结果与知识-回路未对齐假设一致:记忆的表示可在内部存在,但可能未被路由到计算有效的层。为证明这一诊断发现的实用性,我们设计了一个简单启发式策略,能够恢复泛化失败中58–75%的oracle改善空间。实验跨领域进行以确保结果稳健性。代码和数据已在https://anonymous.4open.science/r/Mem2Gen-71FF开源。

## 1 引言

大语言模型(LLMs)在各种任务上表现出色,但在适应未见信息方面面临重大挑战,从而需要有效的后训练知识更新方法。虽然有检索增强生成(RAG)和知识编辑等方法[Meng et al.](https://arxiv.org/html/2607.08393#bib.bib17); [Gupta et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib13),但微调仍是知识更新的一种基本范式,因为它不仅端到端地操作参数化记忆,还能以可被模型现有推理能力重复使用的方式注入知识。尽管LLMs具有拟合新数据的充足能力[Morris et al. (2025)](https://arxiv.org/html/2607.08393#bib.bib19); [Allen-Zhu and Li](https://arxiv.org/html/2607.08393#bib.bib3),但它们表现出“记住但不会用”的失败[Ovadia et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib23); [Soudani et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib28); [Zhong et al. (2023)](https://arxiv.org/html/2607.08393#bib.bib36); [Cohen et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib7); [Berglund et al.](https://arxiv.org/html/2607.08393#bib.bib5),如图1所示:模型可以记忆新事实(如“悉尼位于[实体]”),但无法可靠地*使用*它们进行下游推理(如“悉尼所在国家的首都是……”)[Zhong et al. (2023)](https://arxiv.org/html/2607.08393#bib.bib36); [Cohen et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib7); [Yao et al. (2025)](https://arxiv.org/html/2607.08393#bib.bib34),从而在简单记忆与灵活泛化之间产生差距。
![图1:记忆-使用差距示意图。](图1说明)
我们将这一现象称为“记忆-使用差距”(Knowing–Using Gap),其特点是两种截然不同的差异:1)**准确率差距**,泛化准确率显著低于记忆准确率;2)**时间滞后**,泛化在记忆之后明显更晚才出现。这一观察引发了对微调机制的根本性研究问题:一旦一个事实被记忆,它何时以及为何能够被模型现有的推理回路所访问?为解决这些问题,我们对知识注入过程中的训练动态进行了细粒度分析。我们从两个真实领域知识库构建数据集,并消除与预训练的重叠。我们定义了两类推理问答(QA)任务来评估LLMs如何泛化所学知识:**链式任务**需要在第一跳中解析桥接实体以解决第二跳;**交集任务**需要为两个实体检索属性,并通过所需关系进行过滤。这些任务明确测试注入的知识能否被传播到孤立回忆之外的推理中。为探究底层机制,我们引入了**self-patching**,这是激活修补(activation patching)的一种变体[Ghandeharioun et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib12); [Zhang and Nanda](https://arxiv.org/html/2607.08393#bib.bib35),它从源运行中复制某锚定位置的隐藏层表示,并将其替换到目标运行的目标层中,然后测量正确答案概率的变化。通过对LLM的层以及微调过程进行全面扫描,self-patching生成了知识渗透的时间演化细粒度空间图,识别出哪些层和位置包含的表示在路由到适当位置时能够解锁正确答案。基于这一观察,我们提出了**知识-回路未对齐假设**来解释记忆-使用差距。Self-patching揭示,在记忆饱和后,注入的信息可以从某些层检索到,但并未可靠地整合到多跳推理所需的计算中。记忆之后的持续微调有时会将这些可用表示带到中层计算中,与泛化的出现相吻合;而在其他情况下,它会失败,因为自然梯度消失后表示仍然被困。进一步的干预实验提供了支持该假设的因果干预证据:即使在自然微调收敛后,仅仅重新定位记忆的表示就能在模型和任务之间立即产生显著提升。这表明注入知识的泛化能力可以被人为激活,即使在微调期间它并未自然出现。此外,提升幅度远远超过CoT等提示基线以及通用扰动控制,强化了以下假设:改进源于将知识相关信息转移到推理计算路径,而非表面解码效果。为展示这一发现的实用价值,我们证明了一个利用修补位置结构的简单启发式策略仍能恢复oracle改善空间的58–75%(§5.5),从而将贡献从纯粹诊断推向实用补救。总结如下:
- • 我们识别并量化了LLM微调过程中的“记忆-使用差距”。
- • 我们引入了**self-patching**,一种基于干预的方法,用于绘制注入知识在哪些层成为*因果可用*的,包括失败的泛化案例。
- • 我们提出了**知识-回路未对齐假设**,提供了机制性证据,表明手动重新定位记忆表示可以恢复泛化,并通过设计一个**固定的非oracle启发式**(恢复oracle改善空间的58–75%)证明了其实用性。这些现象和结果通过全面实验在领域和架构之间具有稳健性。
- • 我们发布了一个专门的**记忆到泛化数据集**,用于评估注入知识上的多跳推理。

表1:任务定义概览。**记忆任务**用于微调,**通用化任务**用于评估。左侧图表说明了支持事实的拓扑结构。

| 记忆任务 | 通用化任务 |
| --- | --- |
| **链式**<br>1. 哪种蛋白质在胚胎中表达?IGFBP3。<br>2. 哪种药物靶向蛋白质IGFBP3?Mecasermin。 | 1. 哪种药物靶向在胚胎中表达的蛋白质?Mecasermin。 |
| **交集**<br>1. 哪种暴露与胶质瘤相关?Trifluralin。<br>2. 哪种暴露与甲状腺功能减退相关?Trifluralin。<br>3. (噪声)哪种基因与胶质瘤相关?PLK1。 | 1. 哪种暴露与疾病胶质瘤相关且与甲状腺功能减退相关?Trifluralin。 |

## 2 相关工作

**机制可解释性。** 机制可解释性旨在将神经网络逆向工程为人类可理解的组件,超越行为分析,转向对模型内部的因果解释。先前的方法可分为基于观察的方法,如logit-lens[nostalgebraist (2020)](https://arxiv.org/html/2607.08393#bib.bib21); [Wendler et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib31)、线性探针[Alain and Bengio (2017)](https://arxiv.org/html/2607.08393#bib.bib2); [Belinkov (2022)](https://arxiv.org/html/2607.08393#bib.bib4)以及稀疏自编码器[Huben et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib14); [Gao et al. (2025)](https://arxiv.org/html/2607.08393#bib.bib9)(用于厘清多语义特征);以及基于干预的方法,如因果追踪[Meng et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib18); [Palit et al. (2023)](https://arxiv.org/html/2607.08393#bib.bib24)和激活修补[Wang et al. (2023)](https://arxiv.org/html/2607.08393#bib.bib30)。最近的研究已从分析单个神经元转向回路[Yao et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib33),即模型中负责特定行为的子图。例如,“归纳头”(induction heads)已被识别为上下文学习的主要机制[Olsson et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib22),而其他研究则绘制了负责间接宾语识别[Wang et al. (2023)](https://arxiv.org/html/2607.08393#bib.bib30)和实体追踪[Prakash et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib27)的回路。然而,大多数方法依赖于大规模数据来探查特征和回路。用于定位和提取原子知识的实用工具仍然很少。

**LLM中的知识表示。** “线性表示假设”[Park et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib25)和“键值记忆”[Gershman et al. (2025)](https://arxiv.org/html/2607.08393#bib.bib10)框架认为,LLMs将事实知识(如“A是B”)编码为激活空间中的线性方向,通常存储在MLP层的权重中[Meng et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib18); [Dai et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib8)。基于这种定位,提出了如ROME[Meng et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib18)等模型编辑技术,通过修改MLP权重直接更新特定事实。然而,这些方法的一个关键局限性在于存储事实与利用它进行推理之间的差距[Gupta et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib13)。最近的基准测试如MQuAKE[Zhong et al. (2023)](https://arxiv.org/html/2607.08393#bib.bib36)和RippleEdits[Cohen et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib7)揭示,虽然模型可以回忆编辑后的事实(高记忆率),但它们未能将这些更新传播到多跳推理任务中。

**Grokking与学习动态。** Grokking[Power et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib26); [Wang et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib29); [Liu et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib16)指的是验证集上的泛化性能在训练准确率饱和后很久才突然提高的现象。最初在小型算法任务中观察到[Power et al. (2022)](https://arxiv.org/html/2607.08393#bib.bib26),最近已在大型Transformer的预训练和微调中得到确认[Li et al. (2025)](https://arxiv.org/html/2607.08393#bib.bib15); [Nanda et al. (2023)](https://arxiv.org/html/2607.08393#bib.bib20); [Wang et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib29)。与grokking关注数据集底层新能力的涌现不同,我们的设置关注单条知识被常见逻辑所使用的普遍性。我们认为这种泛化失败并非源于学习新的推理回路,而是源于与这些回路的对齐问题。

## 3 数据集准备

### 3.1 预备知识

为研究LLMs中记忆与泛化的动态,我们构建了一个数据集,包含多样化的记忆和泛化问答任务对。记忆问答任务作为LLM微调材料,使其记忆新知识;而泛化问答任务(未被显式记忆)则测试LLM应用新获取知识的能力。该数据集改编自STaRK[Wu et al. (2024)](https://arxiv.org/html/2607.08393#bib.bib32),这是一个真实世界的半结构化知识库,包含数百万个实体和多种异构类型的关系。我们使用生物医学(STaRK-Prime)和学术(STaRK-MAG)子集,以确保发现跨领域的稳健性。生成流水线详见附录。

### 3.2 任务定义

我们在表1中定义了两类泛化问答任务,以评估LLMs在不同场景下如何泛化所学知识。我们设置中的知识原子单元定义为一个事实三元组:$f=(n_1, e_{12}, n_2)$,其中$n_1, n_2 \in N$分别代表头实体和尾实体,$e_{12}$代表它们之间的关系。例如,事实三元组(MRE11, ppi, ATRX)表示“蛋白质MRE11与蛋白质ATRX相互作用”这一事实。每个泛化任务基于一组支持事实三元组,并为每个事实配对一个记忆任务。LLMs首先通过微调记忆问答任务来学习支持事实,然后在一项需要应用所学知识的泛化任务上进行评估。

**记忆任务。** 对于每个$f$,生成一个对应的记忆问答任务$mem_f$作为记忆知识的材料。具体来说,该任务将头实体$n_1$和关系$e_{12}$作为查询,要求模型预测尾实体$n_2$作为正确答案。例如,$mem_f$ = {问:“哪种蛋白质与MRE11($e_{12}$)相互作用($n_1$)?”答:“ATRX($n_2$)”。}

**通用化任务。** 我们在表1中从全面的元路径设计了两类泛化问答任务:(1) **链式任务**:该任务依赖于两个支持任务,要求模型进行顺序推理以得出最终答案。这评估了模型的链式推理能力。(2) **交集任务**:该任务依赖于多个支持任务,要求模型从噪声干扰中识别具有特定关系的共享实体。这测试了模型在其知识集中执行交集的能力。

### 3.3 知识新颖性验证

表2:数据集新颖性评估。所有模型在两个数据集上的0-shot准确率均在活跃泄露过滤前低于6%,确认注入的知识是真正新颖的。

| 模型 | STaRK-Prime (%) | STaRK-MAG (%) |
| --- | --- | --- |
| Qwen-2.5-1.5B | 4.20 | 5.50 |
| Qwen-2.5-3B | 3.80 | 6.00 |
| Qwen-2.5-7B | 4.40 | 5.80 |
| LLaMA-3.2-1B | 4.90 | 5.40 |
| LLaMA-3.2-3B | 3.80 | 5.00 |
| LLaMA-3.1-8B | 4.80 | 5.50 |

为确保注入的知识是真正新颖的,我们首先验证了预训练模型在STaRK-Prime和STaRK-MAG上(表2),在未进行任何微调的情况下,随机抽取的1000个记忆任务上的0-shot准确率均在6%以下。此外,在我们的修补实验(§5)中,

相似文章

基于超网络的大语言模型知识注入的缩放定律

Hugging Face Daily Papers

本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。