AI Engram:探寻人工智能中的记忆痕迹

arXiv cs.AI 论文

摘要

提出一个几何框架来识别“AI engrams”——深度神经网络中的记忆痕迹——将神经科学标准形式化为一个闭式估计器,使得从MLP到LLM的模型能够进行精确的记忆操作。

arXiv:2606.14997v1 公告类型:新 摘要:记忆形成是智能的基础,但深度神经网络是否保留了类似于生物记忆单元的可识别记忆痕迹仍是一个未解之谜。这项工作引入了一个几何框架,通过将神经科学的特异性、重激活、充分性和必要性标准形式化为一个约束逆问题,来识别这样的“AI engrams”。我们推导出一个闭式估计器,可以从全局纠缠的参数中分离出单个记忆痕迹,并表明这种源于生物学的解对应于参数流形上的自然梯度更新。AI engrams 使得对已学知识进行精确的操作成为可能:任何记忆子集都可以通过线性运算进行组合或擦除,无需迭代优化。从简单的MLP到LLM的实验证明了AI engrams的因果有效性和显著的可扩展性。这些结果共同连接了生物记忆理论和人工表示学习,并提供了关于深度网络如何在分布式存储中同时支持功能特异性的几何洞见。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:43

# AI Engram:探寻人工智能中的记忆痕迹 来源:https://arxiv.org/html/2606.14997 ###### 摘要 记忆形成是智能的基础,但深度神经网络是否保留了类似于生物记忆单元的可识别记忆痕迹,仍是一个未解之谜。本文引入了一个几何框架,通过将神经科学的特异性、再激活、充分性和必要性标准形式化为一个约束逆问题,来识别此类“AI Engram”。我们推导出一个闭式估计器,能够从全局纠缠的参数中分离出单个记忆痕迹,并表明这一基于生物学的解对应于参数流形上的自然梯度更新。AI Engram 能够实现对所学知识的手术式操作:任何记忆子集都可以通过线性算术进行组合或擦除,无需迭代优化。从简单的 MLP 到 LLM 的实验证明了 AI Engram 的因果有效性和显著的可扩展性。这些结果共同桥接了生物记忆理论与人工表示学习,并提供了关于深度网络如何在分布式存储中同时支持功能特异性的几何洞见。 Engram, Memory Localization, Memory Entanglement ## 1 引言 参见图注 图1:AI Engram 神经科学标准示意图。目标概念 $c$ 的 Engram $\boldsymbol{\mu}_c^+$ 被识别为满足以下条件的因果基质:i) **特异性**:相对于参考 $\boldsymbol{X}_c^-$,选择性编码目标经验 $\boldsymbol{X}_c^+$;ii) **再激活**:一致地再现所学内部表征 $\boldsymbol{Z}_c^+$;iii) **充分性**:将 $\boldsymbol{\mu}_c^+$ 注入到空状态 $\boldsymbol{\mu}_{\text{null}}$ 中可诱导记忆;iv) **必要性**:从学习状态 $\boldsymbol{\mu}_{\text{all}}$ 中手术切除 $\boldsymbol{\mu}_c^+$ 可消除记忆。

记忆是智能的基础 (Hawkins & Blakeslee, 2004 (https://arxiv.org/html/2606.14997#bib.bib20))。当系统学会构建有意义的现实表征时,智能便涌现出来 (Bengio et al., 2013 (https://arxiv.org/html/2606.14997#bib.bib3)),这表明记忆的功能并非被动存储,而是模拟现实的结构化表征 (Ha & Schmidhuber, 2018 (https://arxiv.org/html/2606.14997#bib.bib19))。本文从这样一个前提开始:表征在神经网络内形成具体的、可识别的结构,类似于神经 Engram (Semon, 1921 (https://arxiv.org/html/2606.14997#bib.bib44))。基于这一思想,我们引入了一种在模型参数中定位此类结构的方法——这是对神经科学长期追寻记忆物理基质目标的人工智能平行探索。

长期以来,在深度神经网络中识别物理记忆痕迹一直难以实现,因为所学参数同时参与多种行为,产生的表征本质上是分布和纠缠的 (Hinton, 1984 (https://arxiv.org/html/2606.14997#bib.bib22); Elhage et al., 2022 (https://arxiv.org/html/2606.14997#bib.bib12); Bau et al., 2017 (https://arxiv.org/html/2606.14997#bib.bib2))。本文引入了一个分析框架,将 **AI Engram** 从全局纠缠的参数中分离出来。与启发式归因方法不同,我们定义了基于神经科学的约束条件,这些约束条件能产生一个闭式解,并直接从训练好的权重和激活统计量中精确恢复记忆痕迹。具体来说,我们将 AI Engram 表述为一个受四个经典标准(图1 (https://arxiv.org/html/2606.14997#S1.F1))支配的逆问题:**特异性、再激活、充分性和必要性** (Josselyn & Tonegawa, 2020 (https://arxiv.org/html/2606.14997#bib.bib27); Tomé et al., 2024 (https://arxiv.org/html/2606.14997#bib.bib49))。通过强制执行这些约束,我们提取出负责特定记忆的唯一最优基质。理论分析表明,我们的框架允许一种信息几何解释,揭示其与参数流形底层曲率的联系。通过将生物学标准转化为代数优化约束,我们表明这些约束自然产生了 Fisher 度量下的最小范数投影。主要贡献总结如下,代码可在 https://github.com/jeakwon/ai-engram 获取。

- • **识别深度神经网络中记忆痕迹的框架**:通过将生物学标准转化为代数约束,我们推导出一个可扩展的闭式估计器,用于隔离 AI Engram。
- • **摊销的记忆隔离**:我们的框架将记忆痕迹从纠缠的参数流形中解耦,使得能够通过简单的线性算术即时组合或擦除知识。这种方法解决了遗忘的组合复杂性,展示了从简单 MLP 到十亿参数 LLM 等不同架构上的鲁棒性。
- • **Engram 与信息几何之间的联系**:我们发现,这个源自神经科学启发约束的闭式估计器恢复了 Fisher 曲率,与参数流形上的自然梯度方向一致。

## 2 相关工作 ##### 选择性知识操控 控制预训练模型的行为通常依赖于识别和修改编码特定知识的参数。在机器遗忘中,这种有目标的干预,通常通过选择性微调,可以有效移除指定训练数据的影响 (Fan et al., 2024 (https://arxiv.org/html/2606.14997#bib.bib13))。模型编辑遵循类似的原则,诸如统一概念编辑 (UCE) (Gandikota et al., 2024 (https://arxiv.org/html/2606.14997#bib.bib16)) 等进展扩展了早期的方法,如 TIME (Orgad et al., 2023 (https://arxiv.org/html/2606.14997#bib.bib41))、MEMIT (Meng et al., 2023 (https://arxiv.org/html/2606.14997#bib.bib39)) 和 ROME (Meng et al., 2022 (https://arxiv.org/html/2606.14997#bib.bib38)),实现了无需迭代优化即可同时擦除和去偏多个概念。尽管 UCE 通过避免梯度计算的闭式解实现了高效,但它需要计算隐藏激活的协方差矩阵。我们提出的方法同样提供了闭式更新,但根本区别在于融入了神经科学启发的约束来定义记忆痕迹。

##### 网络分解 解释神经网络的一个核心挑战是将其分解为结构可解释且交互可解释的组件。大多数现有方法分解隐藏激活,使用稀疏自编码器恢复单语义字典元素 (Huben et al., 2024 (https://arxiv.org/html/2606.14997#bib.bib23)),但这些方法并不能对参数本身进行功能分解 (Sharkey et al., 2025 (https://arxiv.org/html/2606.14997#bib.bib46))。在参数空间中,关于权重解缠的工作旨在使用二元掩码隔离功能子网络 (Mallya & Lazebnik, 2018 (https://arxiv.org/html/2606.14997#bib.bib35); Ramanujan et al., 2020 (https://arxiv.org/html/2606.14997#bib.bib43); Panigrahi et al., 2023 (https://arxiv.org/html/2606.14997#bib.bib42))。超越掩码,任务算术 (Ilharco et al., 2023 (https://arxiv.org/html/2606.14997#bib.bib24)) 表明,通过将模型权重视为向量,不同的能力可以线性分离。然而,这些方法通常运行在粗粒度的全局层面。线性参数分解 (Braun et al., 2025 (https://arxiv.org/html/2606.14997#bib.bib5)) 被引入以解决此问题,通过在参数空间中将神经网络分解为子组件。Braun 等人 (2025 (https://arxiv.org/html/2606.14997#bib.bib5)) 提出了基于归因的参数分解 (APD),但它依赖于基于梯度的归因,对超参数选择高度敏感且不可扩展。随机参数分解 (SPD) (Bushnaq et al., 2025 (https://arxiv.org/html/2606.14997#bib.bib6)) 已被提出通过使用可学习的秩一子组件来解决此问题。与之前产生非唯一子组件或依赖迭代梯度优化的工作相比,我们的方法在单次前向传播中将模型分解为唯一的子组件(或 Engram)。

## 3 定义学习与记忆 ##### 概述。 现代神经网络以深度纠缠的方式存储知识,单个权重矩阵同时支持许多概念,没有从参数到特定记忆的明显映射。这种纠缠是手术式知识操控(例如,无需重新训练移除一个概念,无需微调插入一种行为,或审计模型所知内容)的主要障碍。本文的目标是在训练好的权重中识别**特定概念的因果基质**,即切除它会移除该概念、注入它会赋予该概念,同时保持无关知识完整的子组件。遵循经典神经科学,我们将这种基质称为 **Engram**,并通过将记忆研究中的四个经典标准(特异性、再激活、充分性、必要性)转化为参数空间上的代数约束来形式化其识别。我们首先正式定义任何可学习系统对经验 $D$(例如,训练数据)的学习。

###### 定义 3.1(系统与经验)。 我们将可学习系统 $f$ 定义为元组 $(\boldsymbol{\mu}, \boldsymbol{\pi})$,包括:
- • **可变组件 $(\boldsymbol{\mu})$**:通过经验更新的可塑元素(例如,突触权重)。
- • **不可变组件 $(\boldsymbol{\pi})$**:保持不变的固定元素(例如,架构)。

给定输入 $\boldsymbol{X}$,系统产生输出 $\boldsymbol{Y} = f(\boldsymbol{X}; \boldsymbol{\mu}, \boldsymbol{\pi})$。我们用 $\boldsymbol{\mu}_t$ 表示时刻 $t$ 的记忆状态,其中 $t=0$ 和 $t=1$ 分别对应学习经验 $D$ 之前和之后的状态。

###### 定义 3.2(概念)。 我们将 **概念 $\mathcal{C}$** 定义为一个功能规范,通过划分输入空间来支配可变参数 $\boldsymbol{\mu}$ 在架构 $\boldsymbol{\pi}$ 下的适应方式:
- • **目标区域 $(\boldsymbol{X}^+)$**:需要**功能获得**来编码新表征的输入。
- • **参考区域 $(\boldsymbol{X}^-)$**:在先前表征的零空间内,现有行为必须表现出**功能保守**的输入。

### 3.1 将 Engram 识别视为一个逆问题 在现实的学习场景中,总参数更新 $\Delta\boldsymbol{\mu} = \boldsymbol{\mu}_1 - \boldsymbol{\mu}_0$ 由混合经验 $D = \{\boldsymbol{X}^+, \boldsymbol{X}^-\}$ 驱动,其中 $\boldsymbol{X}^+$ 表示目标输入,$\boldsymbol{X}^-$ 表示先前或无关的知识。由于学习必须同时在 $\boldsymbol{X}^+$ 上获取新行为,同时在 $\boldsymbol{X}^-$ 上保持现有行为,因此产生的更新 $\Delta\boldsymbol{\mu}$ 变得**物理上纠缠**,多个记忆痕迹在重叠的参数方向上叠加。因此,隔离唯一的 Engram $\boldsymbol{\mu}^+$ 是一个受两个生物学原则约束的**逆问题**(见图1 (https://arxiv.org/html/2606.14997#S1.F1))。首先,**表征性质**要求 (i) 对目标 $\boldsymbol{X}^+$ 相对于参考输入 $\boldsymbol{X}^-$ 的**特异性**,以及 (ii) 内部表征 $\boldsymbol{Z}_t$ 的选择性**再激活**。其次,**因果有效性**要求 $\boldsymbol{\mu}^+$ 满足 (iii) 通过注入诱导所学行为的**充分性**,以及 (iv) 通过切除表达所学行为所必需的**必要性**。

具体实例化。 对于 CIFAR-10 猫遗忘场景,概念 $\mathcal{C} = \text{``猫''}$ 将训练数据划分为目标集 $\boldsymbol{X}^+$(猫图像)和参考集 $\boldsymbol{X}^-$(其余九个类别)。这四个神经科学标准具体转化为:**特异性**要求 $\boldsymbol{\mu}_{\text{cat}}^+$ 在非猫图像上保持惰性;**再激活**要求它再现网络针对猫的内部状态;**充分性**要求将其注入到原始模型中能赋予猫识别能力;**必要性**要求将其切除后删除猫识别能力,同时保持其他九个类别不变。本文的其余部分将为 $\boldsymbol{\mu}_{\text{cat}}^+$ 及其多概念泛化开发一个闭式估计器。

## 4 深度神经网络中的 AI Engram ### 4.1 记忆的突触分解 在深度神经网络中,可变参数集 $\boldsymbol{\mu}$ 包含所有层的所有可训练权重,表示为 $\boldsymbol{\mu} = \{\boldsymbol{W}^{(1)}, \boldsymbol{W}^{(2)}, \dots, \boldsymbol{W}^{(L)}\}$。对于给定的经验 $\boldsymbol{X}^+$,我们将相应的 **记忆 Engram $\boldsymbol{\mu}^+$** 定义为该经验在网络中诱导的**因果**参数更新的集合:
\[
\boldsymbol{\mu}^+ = \{\boldsymbol{W}^{+(1)}, \dots, \boldsymbol{W}^{+(L)}\}.
\tag{1}
\]
为了使 Engram 识别问题易于处理,我们将其分解为逐层的子问题。对于每一层 $l$,目标是恢复**突触 Engram $\boldsymbol{W}^{+(l)}$**,即因果记忆痕迹的特定层分量。

### 4.2 线性 $\boldsymbol{Z}$ 空间中的回顾式形式化 我们在预激活空间 $\boldsymbol{Z} = \boldsymbol{W}\boldsymbol{X}$ 中形式化突触 Engram,在此处权重更新的影响可以在没有非线性失真的情况下被隔离。¹¹¹层上标为简洁起见省略;偏置项通过输入增广吸收到 $\boldsymbol{W}$ 中。 由于激活函数 $\sigma(\cdot)$ 是固定的,匹配内部状态 $\boldsymbol{Z}$ 为再现功能输出 $\boldsymbol{Y} = \sigma(\boldsymbol{Z})$ 提供了充分且更严格的条件。Engram 识别是在完全训练好的网络($t=1$)上**回顾式**进行的。利用此最终状态下的输入统计量 $\boldsymbol{X}$ 将分析锚定在目标记忆所在的**稳定表征流形**上,确保隔离的 Engram 反映了模型收敛后的因果结构。

### 4.3 代数约束框架 我们通过对比自然学习过程中产生的**观测状态**和通过**代数**操作生成的**干预状态**来识别 $\boldsymbol{W}^+$。这种对比隔离了支撑所学记忆表达的具体权重变化(如表1 (https://arxiv.org/html/2606.14997#S4.T1) 中两种状态条件的详细说明)。

表 1:将 Engram 公理操作化为优化约束。 通过对比观测状态与干预状态,我们从四个神经科学 Engram 标准中建立了形式化的线性代数约束:i) **特异性** ($X^\pm$,目标 vs. 参考),ii) **再激活** ($\bar{Z}_{\{0,1\}}^\pm$,内部表征),iii) **充分性** ($\ddagger$,功能获得) 和 iv) **必要性** ($\dagger$,功能丧失)。 形式化约束指定突触 Engram $\boldsymbol{W}^+$ 隔离了 $\Delta\boldsymbol{W}$ 中能够选择性重构目标记忆 $\boldsymbol{X}^+$ 同时保持参考子空间惰性的分量。为了满足**充分性**,注入 Engram 必须再现所学内部状态(产生 $\bar{\boldsymbol{Z}}_1^+ \approx \boldsymbol{Z}_1^+$),而切除它必须恢复朴素状

相似文章

AI身份能否从外部记忆结构中涌现?

Reddit r/AI_Agents

一份研究报告,详细描述了构建外部记忆架构的受控实验,该架构能够实现独立于模型权重的持久性AI身份。研究发现,在三种拓扑结构中,积累的片段历史在塑造输出方面始终主导系统提示。

Phoenix Grove AI中AI记忆的3D思维导图

Reddit r/ArtificialInteligence

Phoenix Grove AI推出了Memory Constellations,这是一种AI记忆嵌入的3D可视化,展示了数据点之间的关系并随时间演变。