超越记忆:长上下文检索中任务条件化的符号化FFN写入

arXiv cs.LG 论文

摘要

本文研究了长上下文检索中FFN残差写入的符号性质,发现FFN写入根据层和任务的不同起到抑制或放大作用,并提出了一种基于梯度的诊断方法来区分这两种角色。

arXiv:2607.16254v1 公告类型:新 摘要:FFN通常被视为参数化记忆。然而,在长上下文检索中,更尖锐的问题不仅在于它们存储了什么,还在于它们本地的残差写入是否将当前检索状态推向或远离正确答案。我们通过逐层缩放模型自身的FFN写入来测试这一点,无需编辑权重或注入外部引导向量。 在受控的字面检索和语义检索套件中,本地FFN响应表面呈现符号化、逐层依赖且任务条件化特性:在8个模型-套件组合中,最终FFN在7个案例中表现为抑制器,且60%的层在检索模式之间切换角色(95%置信区间[50%, 69%])。沿本地写入方向的局部方向导数可区分这两种单调角色:抑制器在34/35案例中具有负导数,放大器在18/18案例中具有正导数,因此角色不能归结为写入大小。在经安全过滤的LongBench检索-QA探针上,同一诊断预测了衰减损伤,原始R²在Qwen2.5-7B上为0.796,在Qwen3.5-9B上为0.791;一个保留的抑制器-衰减策略相比随机和范数匹配对照提升了检索裕度。这些结果表明,本地FFN缩放揭示了检索中符号化、任务条件化的残差写入结构,且写入-梯度对齐是两种单调角色的紧凑诊断工具。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# 任务条件化的符号化 FFN 写入在长上下文检索中的应用
来源:https://arxiv.org/html/2607.16254
(2026 年 6 月)

###### 摘要

FFN 通常被视为参数化记忆。然而,在长上下文检索中,一个更尖锐的问题不仅在于它们存储了什么,还在于它们原生的残差写入是否将当前检索状态推向或远离正确答案。我们通过逐层缩放模型自身的 FFN 写入来测试这一点,无需编辑权重或注入外部引导向量。

在受控的字面和语义检索套件中,原生的 FFN 响应面是符号化的、特定于层的且任务条件化的:在 8 个模型-套件案例中有 7 个案例中,最后一个 FFN 是抑制器,并且 60% 的层在两种检索模式之间切换角色 (95% CI [50%, 69%])。沿着原生写入的局部方向导数区分了两种单调角色:在 34/35 个案例中抑制器具有负导数,而在 18/18 个案例中放大器具有正导数,因此这些角色不能简化为写入大小。在安全过滤的 LongBench 检索-QA 探针上,相同的诊断预测了衰减损伤,在 Qwen2.5-7B 上 raw-R²=0.796,在 Qwen3.5-9B 上为 0.791;一个未参与训练的抑制器-衰减策略比随机和范数匹配的控制方法提高了检索边界。这些结果表明,原生 FFN 缩放揭示了检索中一种符号化的、任务条件化的残差写入结构,并且写入-梯度对齐是两种单调角色的简洁诊断方法。

## 1 引言

机制可解释性的一个核心成果是 Transformer 前馈网络 (FFN) 表现为键值记忆:它们存储关联,用事实信息丰富残差状态,并暴露可编辑的事实内容 (Geva 等人, 2021 (https://arxiv.org/html/2607.16254#bib.bib1), 2022 (https://arxiv.org/html/2607.16254#bib.bib2); Meng 等人, 2022 (https://arxiv.org/html/2607.16254#bib.bib4); Dai 等人, 2022 (https://arxiv.org/html/2607.16254#bib.bib5); Geva 等人, 2023 (https://arxiv.org/html/2607.16254#bib.bib3))。这种观点现在具有工程后果。最近的架构使记忆更加明确、稀疏或模块化:Memory Layers 添加了可训练的键值查找模块 (Berges 等人, 2024 (https://arxiv.org/html/2607.16254#bib.bib22));DeepSeek Engram 将条件记忆查找作为独立的稀疏性轴引入 (Cheng 等人, 2026 (https://arxiv.org/html/2607.16254#bib.bib23));MemoryLLM 将 FFN 记忆与自注意力和残差流解耦 (Jaiswal 等人, 2026 (https://arxiv.org/html/2607.16254#bib.bib24));STEM 用嵌入模块替换了部分 FFN 计算 (Sadhukhan 等人, 2026 (https://arxiv.org/html/2607.16254#bib.bib25));而 PEER 风格的路由从许多微型专家中检索 (He, 2024 (https://arxiv.org/html/2607.16254#bib.bib26))。其操作前提是,可以分解、稀疏化或替换 FFN 记忆,而不会损失相关能力。

如图 1 (https://arxiv.org/html/2607.16254#S1.F1) 所示,架构上的复杂性在于,原生 FFN 不是一个侧表。关键点不在于 FFN 是唯一在残差流上操作的 Transformer 模块;注意力和归一化也参与残差计算。关键点更狭窄且对记忆观点更具后果:类似记忆的 FFN 计算被内嵌写入到后续检索计算所使用的同一个状态中。

![[无标题图片]](https://arxiv.org/html/2607.16254v1/x1.png)

参见图注

图 1:无干预的原生 FFN 残差流。注意力首先将上下文证据聚合到目标令牌的残差状态中,FFN 计算原生写入 ΔF_l,并通过残差加法将 h_{l+1} = u_l + ΔF_l 写入到后续注意力层和输出头消费的流中。这里没有应用增益缩放或损伤度量。一个 Transformer 层写入

h_{l+1} = u_l + ΔF_l, u_l := h_l + Attn_l(h_l),

进入每个后续层都读取的残差流。在长上下文检索中,注意力首先将上下文证据聚合到目标令牌的残差状态;然后 FFN 应用唯一的令牌间非线性变换,位于连续注意力层之间,并将 ΔF_l 写回同一个流中;后续的注意力层和输出头消费该变换后的状态。这提出了两个问题:Q1,FFN 写入是否影响跨层检索信息流?Q2,如果影响,方向如何,并且该方向是否依赖于任务?

我们使用原生 FFN 缩放(图 2 (https://arxiv.org/html/2607.16254#S3.F2))来测试这种观点:

h_{l+1} ← u_l + α ΔF_l, α ∈ {0, 0.25, ..., 2},

一次一层。我们使用这种干预是因为它隔离了原生残差写入的因果作用。它不编辑权重,不注入外部引导向量,也不替换注意力模式;它保留 ΔF_l 的学习内容和方向,同时仅改变其在单层的增益。恒等点 α=1 是未修改的模型,α<1 询问衰减或移除同样的写入是否有助于检索,而 α>1 询问是否相同写入的更强表达放大了其效果。因此,所得剂量-反应区分了两种解释。如果 FFN 仅作为被动记忆,减少其写入应该主要移除有用的存储信息。符号化写入假设预测一个更强且更具体的模式:反应应该是符号化的。一些层在跳过时有助于检索,一些层在跳过时有害,并且同一层在检索模式改变时可以改变角色。

前向干预回答了 FFN 写入是否具有符号化的因果效应。下一个问题是这种模式是否可以用架构内部信号来解释。在原生点 α=1 附近,检索边界沿着模型自身的 FFN 写入方向变化。在第 l 层,前向 FFN 写入 ΔF_l 和反向检索梯度 ∇M 在同一个残差节点相遇(图 3 (https://arxiv.org/html/2607.16254#S3.F3))。它们的内积

s_l = ΔF_l^⊤ ∇M

是沿着原生写入的检索边界的局部方向导数。我们将这个量用作机制锚点,而不是作为因果干预的替代:缩放实验定义了角色,而方向导数测试了角色是否遵循写入方向。

#### 贡献。

1. 1.符号化 FFN 角色分类法。原生 FFN 缩放在长上下文检索中揭示了校准、放大和抑制三种角色。这些角色是特定于层且任务条件化的:在 8 个受控模型-套件案例中,最终层在 7 个案例中是抑制器,并且 60% 的层在字面和语义检索之间切换角色。
2. 2.方向机制和控制。局部方向导数锚定了两种单调角色:在 34/35 个案例中,抑制器的写入指向与检索目标相反的方向,而在 18/18 个案例中,放大器的写入指向与目标一致的方向。种子稳定性、阈值扫描和残差大小控制表明,该分类法不是种子伪影、阈值伪影或仅范数效应。
3. 3.自然转移和诊断意义。一个安全过滤的 LongBench 检索-QA 探针将相同的诊断转移到自然语言问答,并且一个有针对性的衰减合理性检查表明,抑制器层是有因果意义的控制点。这为检索设置中的 FFN 替换或解耦研究提供了一个具体诊断:评估写入方向,而不仅仅是查找准确性。

表 1:声明-测试契约。本文组织为一条单一链条:符号化因果效应、任务条件化以及局部方向解释。

## 2 相关工作

### 2.1 FFN 作为记忆及其工程后果

Geva 等人 (2021 (https://arxiv.org/html/2607.16254#bib.bib1), 2022 (https://arxiv.org/html/2607.16254#bib.bib2)) 通过将 FFN 子层解释为键值记忆,建立了 FFN 作为记忆的观点。编辑工作表明,事实关联可以在 FFN 权重处定位 (Meng 等人, 2022 (https://arxiv.org/html/2607.16254#bib.bib4); Dai 等人, 2022 (https://arxiv.org/html/2607.16254#bib.bib5)),而 Geva 等人 (2023 (https://arxiv.org/html/2607.16254#bib.bib3)) 将事实丰富追溯到早期 MLP 子层,最终提取由注意力介导。这条线索解释了 FFN 存储什么以及存储的关联如何被定位或编辑。

最近的架构工作将这种记忆观点转化为一个设计轴。Memory Layers 添加了明确的可训练查找模块 (Berges 等人, 2024 (https://arxiv.org/html/2607.16254#bib.bib22));DeepSeek Engram 将条件记忆查找作为独立的稀疏性轴引入 (Cheng 等人, 2026 (https://arxiv.org/html/2607.16254#bib.bib23));MemoryLLM 将 FFN 记忆与自注意力和残差流解耦 (Jaiswal 等人, 2026 (https://arxiv.org/html/2607.16254#bib.bib24));STEM 用嵌入模块替换了部分 FFN 计算 (Sadhukhan 等人, 2026 (https://arxiv.org/html/2607.16254#bib.bib25));而 PEER 风格的路由从许多微型专家中检索 (He, 2024 (https://arxiv.org/html/2607.16254#bib.bib26))。这些工作在架构上解耦了记忆。我们在传统 Transformer 中诊断出一个互补性质:类似记忆的 FFN 计算被内嵌写入到残差流中。解耦文献解决了模块检索了什么;我们询问检索到的或变换后的向量将当前的检索目标推向哪里以及何种方向。第 6 节 (https://arxiv.org/html/2607.16254#S6) 讨论了检索设置中更狭窄的设计后果:FFN 替换研究应检查替换是否保留了与检索相关的写入方向,而不仅仅是查找行为。

### 2.2 逐层 FFN 重要性

Pires 等人 (2023 (https://arxiv.org/html/2607.16254#bib.bib14)) 表明 FFN 可以是冗余的并且可以被一个加宽的 FFN 替换;Men 等人 (2024 (https://arxiv.org/html/2607.16254#bib.bib15)) 按冗余度对块进行排序;Ikeda 等人 (2025 (https://arxiv.org/html/2607.16254#bib.bib16)) 表明将 FFN 容量重新分配到中间层可以改进下游任务。这些工作将 FFN 重要性报告为大小、冗余度或相对收益分数。我们的角色分类法是互补的:它测量一个符号化的、任务依赖的每层反应。一个大的 FFN 写入不一定有帮助,一个小的写入不一定无关紧要;原生写入相对于检索目标的方向决定了两种单调角色。

### 2.3 长上下文检索

长上下文基准表明,检索在行为上是微妙的 (Kamradt, 2023 (https://arxiv.org/html/2607.16254#bib.bib13); Liu 等人, 2023 (https://arxiv.org/html/2607.16254#bib.bib10); Hsieh 等人, 2024 (https://arxiv.org/html/2607.16254#bib.bib9); Bai 等人, 2024 (https://arxiv.org/html/2607.16254#bib.bib11); Zhang 等人, 2024 (https://arxiv.org/html/2607.16254#bib.bib12))。最相关的是 Modarressi 等人 (2025 (https://arxiv.org/html/2607.16254#bib.bib8)),它表明字面和语义检索是不同的能力,并将差距主要归因于注意力。我们的实验将该差异的一部分定位到 FFN 写入方向:相同的 FFN 层可以在检索模式改变时切换其整个因果角色。此处使用 LongBench 并不是作为排行榜基准,而是作为自然语言检索-QA 探针,用于测试符号化表面和方向导数诊断是否从受控合成检索转移到自然语言。

### 2.4 激活引导

Subramani 等人 (2022 (https://arxiv.org/html/2607.16254#bib.bib19));Turner 等人 (2023 (https://arxiv.org/html/2607.16254#bib.bib20));Li 等人 (2023 (https://arxiv.org/html/2607.16254#bib.bib17));Panickssery 等人 (2024 (https://arxiv.org/html/2607.16254#bib.bib18)) 通过注入残差向量来引导行为;Bas 和 Novak (2025 (https://arxiv.org/html/2607.16254#bib.bib21)) 报告了引导系数的倒 U 形。我们转而缩放模型的原生 FFN 残差写入,并将响应解读为符号化角色分类法。贡献不在于残差干预可以改变行为;而在于原生 FFN 写入形成一个任务条件化的符号化结构,并且单调角色由沿着原生写入的检索边界局部方向导数锚定。

## 3 原生 FFN 写入和局部方向

图 1 (https://arxiv.org/html/2607.16254#S1.F1) 显示了原生 FFN 写入在干预前进入残差流的位置。图 2 (https://arxiv.org/html/2607.16254#S3.F2) 总结了前向残差写入干预。图 3 (https://arxiv.org/html/2607.16254#S3.F3) 总结了用于分类和解释符号化角色的端点-响应和方向导数诊断。

![[无标题图片]](https://arxiv.org/html/2607.16254v1/x2.png)

图 2:FFN 残差写入干预。在正常前向传递中,注意力将上下文证据聚合到目标令牌的残差状态,FFN 将变换后的向量 ΔF_l 写回同一残差流中,后续注意力将读取该流。原生 FFN 缩放仅改变该写入的强度,h_{l+1} ← u_l + α ΔF_l,并且读出边界给出 D_l(α) = M_base - M_l(α)。

![[无标题图片]](https://arxiv.org/html/2607.16254v1/x3.png)

图 3:符号化角色诊断。端点响应根据 D_l(0) 和 D_l(2) 的符号对每一层进行分类,产生校准、放大或抑制角色。后向诊断测量相同的原生写入是与检索目标方向一致还是相反:前向写入 ΔF_l 和检索梯度在同一个残差节点相遇,内积 s_l = ΔF_l^⊤ ∇M 是锚定两种单调角色的局部方向导数。

### 3.1 架构事实:原生 FFN 写入被下游消费

一个预归一化的 Transformer 层将残差流演化如下

h_{l+1} = h_l + Attn_l + FFN_l = u_l + ΔF_l。

在 Llama、Qwen 和 SmolLM2 风格的序列模型中,FFN_l 读取 u_l;在 Pythia 和 GPT-NeoX 风格的并行模型中,它读取 h_l(第 7 节 (https://arxiv.org/html/2607.16254#S7))。在检索中,注意力将上下文证据聚合到目标令牌的残差状态。然后 FFN 应用一个令牌间的非线性变换,并将 ΔF_l 写回同一个残差流。后续的注意力层和输出头消费这个变换后的状态(图 2 (https://arxiv.org/html/2607.16254#S3.F2))。残差连接本身不是一个新观察。我们测试的是 ΔF_l 的方向是否符号化、任务条件化,并且是否可以从局部方向导数预测。

### 3.2 干预设计:原生 FFN 缩放

我们缩放原生写入

h_{l+1} ← u_l + α ΔF_l, α ∈ {0, 0.25, ..., 2},

一次一层(图 2 (https://arxiv.org/html/2607.16254#S3.F2))。我们报告 D_l(α) = M_base - M_l(α),因此 D_l(α) > 0 意味着干预损害了检索,D_l(α) < 0 意味着它帮助了检索。我们使用端点而非

相似文章

内存管理的长上下文注意力:可编辑请求本地内存的初步研究

arXiv cs.CL

本文研究了内存管理的长上下文注意力,这是一个将高效状态压缩与显式可编辑内存槽分开的研究方向。实验表明,结合快速循环/稀疏主干网络与显式内存管理的混合方法,在合成任务和长上下文基准测试中均优于纯固定状态或纯稀疏方法。

Transformer FFN神经元的稀疏层间依赖

arXiv cs.LG

本文介绍了一种无需训练的归因方法,用于识别Transformer FFN神经元中稀疏的层间依赖,结果表明少量前序激活足以高保真地保留神经元激活。