预测性记忆定位:从内部信号预测选择性干预路径
摘要
本文介绍了预测性记忆定位(PML),一种从模型内部信号预测选择性干预结果的方法,能够区分校准的目标移动与语义邻居及能力损伤。在3000条记录和九个数据集上的实验显示,选择性路径预测和风险感知的干预决策均得到改善。
arXiv:2608.12892v1 公告类型:新
摘要:激活引导将局部化表征转化为控制方向,但仅靠定位并不能揭示某个方向是否具有选择性工作区间。我们引入了预测性记忆定位(Predictive Memory Localization, PML),将测量网格上的干预路径视为记忆定位的预测目标。PML 将随机校准的目标移动与语义邻居及能力损伤区分开来,并将静态定位和监督几何与强度分离的低剂量因果响应进行比较。我们的冻结研究涵盖九个数据集、十四个领域的3000条记录,产生30,000条不同的记录-方向-层路径和210,000次不同的路径-强度评估。在第7层,几何推导的 RFM/AGOP 方向达到13.1%的目标任意和12.3%的干净任意,在记录配对自助法下分别超过随机基线3.6和3.4个百分点。在按记录、数据集和领域分组的分割中,|\alpha|=0.1 时的响应是分离强度 |\alpha|\in\{0.25,0.5\} 下结果的最强信号。在保留记录上,预测器驱动的选择器选择系数或弃权,相比训练调优的固定强度策略,提高了效用并减少了语义邻居损伤,同时避免了密集扫描中的大部分评估。在三个残差范数匹配的基础模型中,学习到的方向保持了选择性路径增益,低剂量响应产生0.801-0.828的记录保留宏AUROC。因此,PML 将记忆定位转化为对边际水平选择性结果的可证伪预测,以及一种风险感知的干预决策。
查看缓存全文
缓存时间: 2026/08/14 09:28
# 预测性记忆定位:从内部信号预测选择性干预路径
来源:https://arxiv.org/html/2608.12892
田泽宇 Lucas Qingyang Fang 陈志生 陈爽 罗宇豪 赵千念\通讯作者
###### 摘要
激活引导(Activation steering)将局部化的表示转换为控制方向,但仅靠定位本身并不能揭示某个方向是否存在选择性工作区间。我们提出*预测性记忆定位*(Predictive Memory Localization,PML),它将测量网格上的干预路径视为记忆定位的预测对象。PML 将随机校准的目标移动与语义邻居损伤和能力损伤分开,并将静态定位和监督几何与一种强度不相交的低剂量因果响应进行比较。我们的冻结研究覆盖来自九个数据集和十四个领域的 3,000 条记录,产生 30,000 条不同的记录–方向–层路径以及 210,000 次不同的路径–强度评估。在第 7 层,几何推导的 RFM/AGOP 方向达到 13.1% 的目标任意(target-any)和 12.3% 的干净任意(clean-any),在记录配对自助法下分别比随机方向高出 3.6 和 3.4 个百分点。在按记录、数据集和领域分组的分割中,|α|=0.1 处的响应是预测不相交强度 |α|∈{0.25,0.5} 处结果的最强信号。在留出记录上,预测驱动的选择器要么选择一个系数,要么弃权,与训练调优的固定强度策略相比,提高了效用并减少了语义邻居损伤,同时避免了密集扫描中的大多数评估。在三个残差范数匹配的基础模型上,学习到的方向保持选择性路径增益,低剂量响应产生 0.801–0.828 的记录留出宏平均 AUROC。因此,PML 将记忆定位转化为关于边界层面选择性结果的可证伪预测,以及风险感知的干预决策。
## 1 引言
语言模型内部结构已与前馈记忆、知识神经元和因果重要状态相关联(7(https://arxiv.org/html/2608.12892#bib.bib1);3(https://arxiv.org/html/2608.12892#bib.bib2);14(https://arxiv.org/html/2608.12892#bib.bib4))。这些文献提出了一个操作性假设:一旦信息被定位,相应的表示就应该提供一个有用的控制点。激活引导在不改变模型参数的情况下检验这一假设(26(https://arxiv.org/html/2608.12892#bib.bib10);22(https://arxiv.org/html/2608.12892#bib.bib11);37(https://arxiv.org/html/2608.12892#bib.bib14);23(https://arxiv.org/html/2608.12892#bib.bib19))。然而,行为会随提示、层、模型和系数的不同而变化,而且更强的干预可能损害特异性或无关能力(12(https://arxiv.org/html/2608.12892#bib.bib12);24(https://arxiv.org/html/2608.12892#bib.bib13);25(https://arxiv.org/html/2608.12892#bib.bib20);8(https://arxiv.org/html/2608.12892#bib.bib18))。因此,引导是一个多维控制问题(31(https://arxiv.org/html/2608.12892#bib.bib16);19(https://arxiv.org/html/2608.12892#bib.bib21);33(https://arxiv.org/html/2608.12892#bib.bib22))。
定位描述的是表示,而可控性则是在*测量干预路径*上展现出来的。目标杠杆作用可能与语义邻居或能力损伤共存,一个系数下的干净效果不一定在另一个系数下持续存在。在预先指定的网格上预测校准后的目标、损伤和干净结果,实际上是在问:哪些局部化方向具有可用的测量系数?单个端点无法回答这个问题:同一个方向可能在一个测量强度上表现出杠杆作用,在另一个强度上造成损伤,或者根本不存在两者能干净分离的系数。
我们提出*预测性记忆定位*(PML),它将每条记录、方向和层映射到随机校准的结果上。它把来自基线信念和元数据、静态定位以及监督表示几何的预测证据组织到一种强度不相交的低剂量因果响应上。这一设计直接检验静态证据是否能预测后续行为,或者是否必须进行廉价的因果测量。随后,一个注意附带损伤的策略会选择某个系数或弃权。与生成层面的概念预测(5(https://arxiv.org/html/2608.12892#bib.bib24))不同,PML 使用明确的附带损伤探针和强度不相交标签来审查局部化的事实与推理方向。
图 1:PML 从表示到选择性控制。(a) 方向估计器使用所选块上的期望激活和对比激活,所得方向在该块注入。(b) 静态证据和不相交的低剂量响应预测候选系数的目标收益、附带损伤风险和效用,以便选择或弃权。曲线为示意。
在来自九个数据集和十四个领域的 3,000 条冻结记录上,学习到的方向比随机方向提高了目标和干净路径的发生率。静态定位几乎没有增加预测价值,而不相交的低剂量响应则在分组迁移中主导了后续路径预测。这两个发现都在三个残差范数匹配的基础模型上得到重复(0.801–0.828 的记录留出宏平均 AUROC)。留出选择器相对于固定干预提高了效用并减少了邻居损伤。核心结果是:*一个小的因果响应是预测后续选择性行为最有用的信号*。
本文做出三项贡献:
- •我们定义了一条随机校准的测量网格路径,为每条记录、方向和层联合记录目标杠杆、语义邻居损伤、能力损伤和干净测量系数。
- •我们将静态定位和监督几何与强度不相交的因果探针区分开来,表明前者是较弱的预测先验,而后者在分组和跨模型评估中提供了主导信号。
- •我们将预测与行动联系起来,采用一个留出的注意附带损伤策略,选择某个系数或弃权,为减少密集干预评估提供了概念验证。
## 2 相关工作
#### 知识表示、定位与编辑。
Transformer 内部结构已与前馈记忆、知识神经元和因果重要状态相关联(7(https://arxiv.org/html/2608.12892#bib.bib1);3(https://arxiv.org/html/2608.12892#bib.bib2);14(https://arxiv.org/html/2608.12892#bib.bib4))。编辑使用学习到的编辑器、外部记忆或针对性参数更新(4(https://arxiv.org/html/2608.12892#bib.bib3);17(https://arxiv.org/html/2608.12892#bib.bib5);18(https://arxiv.org/html/2608.12892#bib.bib6);15(https://arxiv.org/html/2608.12892#bib.bib7)),其有效性、泛化性和局部性由综述和工具包加以组织(35(https://arxiv.org/html/2608.12892#bib.bib25);27(https://arxiv.org/html/2608.12892#bib.bib26))。定位不一定能识别支持编辑或遗忘的组件(9(https://arxiv.org/html/2608.12892#bib.bib8);11(https://arxiv.org/html/2608.12892#bib.bib9));PML 检验的是其与干预结果之间的预测联系。
#### 激活引导与控制权衡。
激活工程对中间表示进行干预(26(https://arxiv.org/html/2608.12892#bib.bib10));对比激活加法、表示工程和表示手术通过示例和群体结构构造或分析引导方向(22(https://arxiv.org/html/2608.12892#bib.bib11);37(https://arxiv.org/html/2608.12892#bib.bib14);23(https://arxiv.org/html/2608.12892#bib.bib19))。其他工作研究真实性组件、系数缩放和偏好–效用权衡(12(https://arxiv.org/html/2608.12892#bib.bib12);24(https://arxiv.org/html/2608.12892#bib.bib13);32(https://arxiv.org/html/2608.12892#bib.bib23))。AxBench 比较概念检测和引导方法(31(https://arxiv.org/html/2608.12892#bib.bib16)),而更广泛的评估则暴露了对指令措辞、提示分布、层选择和模型规模的敏感性(25(https://arxiv.org/html/2608.12892#bib.bib20);2(https://arxiv.org/html/2608.12892#bib.bib17);8(https://arxiv.org/html/2608.12892#bib.bib18))。这些研究促使我们联合测量杠杆作用和副作用;PML 还进一步追问:定位证据能否预测它们对每条记录–方向–层路径的共存情况。
#### 可引导性的评估与预测。
可靠的引导评估越来越倾向于将行为成功与连贯性、特异性和意外变化分开(19(https://arxiv.org/html/2608.12892#bib.bib21);33(https://arxiv.org/html/2608.12892#bib.bib22))。最相关的是,5(https://arxiv.org/html/2608.12892#bib.bib24)利用首 token 动态和秩强度预测欠引导、成功引导或过引导,从而减少 rollout。PML 则相反,它在预先指定的系数网格上预测一条记录–方向–层路径,对照随机方向校准目标、语义邻居和能力事件,并优化注意附带损伤的边界效用。其弱特征是在一个被排除在更强系数标签之外的系数上测量的,之后策略选择一个系数或弃权。SteerBoost 面向高效的生成层面概念对齐;PML 检验的是定位和固定低剂量诊断能否预测选择性边界结果。
#### 有监督几何作为诊断工具。
递归特征机使用平均梯度外积来学习任务适应的几何结构(21(https://arxiv.org/html/2608.12892#bib.bib15))。PML 使用其主方向、谱集中度和对齐度作为候选信号,同时明确检验而非假设有监督敏感性意味着选择性控制。
## 3 预测性记忆定位
PML 将局部化的残差表示与一个测量强度索引的干预路径和一个留出决策联系起来(图 1(https://arxiv.org/html/2608.12892#S1.F1))。这里,“记忆定位”指的是与答案关系相关的记录条件化内部信号,而非声称该关系存在于某个唯一的物理组件中。
### 3.1 记录、探针与干预
记录 \(i\) 包含目标提示 \(\mathcal{T}_{i}\)、语义邻居提示 \(\mathcal{N}_{i}\) 和通用能力提示 \(\mathcal{C}_{i}\)。第一组提示表达要抑制或增强的行为;后两组测试邻近知识或无关能力是否被保留。对于具有期望答案 \(y^{+}\) 和对比答案 \(y^{-}\) 的提示 \(x\),答案边界为
\[
m(x)=\log p(y^{+}\mid x)-\log p(y^{-}\mid x).
\]
(1)
所有结果都是相对未扰动边界的变化,这使得不同基线置信度的记录之间的路径具有可比性。
在层 \(\ell\),方法 \(s\) 构造单位范数的记录特定方向 \(\mathbf{v}_{i\ell s}\)。干预强度 \(\alpha\) 将残差激活修改为
\[
\mathbf{h}'_{\ell}=\mathbf{h}_{\ell}+\alpha\mathbf{v}_{i\ell s}.
\]
(2)
负系数和正系数分别用同一方向测试抑制和增强。我们用 \(\Delta^{T}_{i}(\alpha)\) 表示有符号的目标边界移动,用 \(\Delta^{N}_{i}(\alpha),\Delta^{C}_{i}(\alpha)\) 表示邻居和能力移动;足够负的附带变化即为损伤。
### 3.2 随机校准的干预路径
目标、邻居和能力响应的零分布尺度不同,因此随机方向定义各自的第 95 百分位阈值 \(\tau_{T}\)、\(\tau_{N}\) 和 \(\tau_{C}\)。目标效应在预期方向上越过 \(\tau_{T}\),而邻居或能力损伤则越过相应的负阈值。*干净强度*是指在同一系数下产生目标效应但都不越过两个损伤阈值。
在一个有序、有限的强度集合上,这些事件形成一条测量网格干预路径。目标与附带损伤的出现定义了首次观测到的越过点,相邻的干净强度形成观测到的干净区域。这些是描述性的网格统计量,而非对未测量连续窗口的估计。确证性预测任务聚焦于在留出的更强系数上的四个直接测量事件:*Target-any*、语义邻居损伤、能力损伤和*Clean-any*。百分比统计的是记录–方法–层路径的数量,而非提示或单个强度。
### 3.3 预测任务
PML 用逐步增强的证据预测后续路径结果。基线信念 \(B\) 和元数据 \(M\) 被静态定位特征 \(L\) 以及(对于 RFM 的)几何特征 \(G\) 所增强。低剂量响应特征 \(R\) 测量 \(\alpha=\pm 0.1\) 处的目标和附带移动。由于 \(R\) 需要干预,它是一种廉价的动态诊断,而非静态定位。核心比较检验 \(L\) 或 \(G\) 是否在 \(B+M\) 之上有所改进,以及强度不相交的响应 \(R\) 能否预测 \(|\alpha|\in\{0.25,0.5\}\) 处的结果。下游策略随后利用这些预测选择一个系数或弃权。
## 4 信号与预测模型
PML 在多个方向族上评估一条共同的路径预测和决策流水线,将方向质量与用于预测其后续行为的证据分开。
### 4.1 方向族
#### 随机控制。
一个带种子的单位范数高斯方向定义了响应阈值和配对零基线。记录的 `matched_norm_random` 条目在数值上与之一致,仅保留用于审计目的。
#### 均值差。
对于正激活集 \(\mathcal{H}^{+}\) 和对比激活集 \(\mathcal{H}^{-}\),我们使用
\[
\mathbf{v}_{\mathrm{mean}}=\frac{\boldsymbol{\mu}^{+}-\boldsymbol{\mu}^{-}}{\|\boldsymbol{\mu}^{+}-\boldsymbol{\mu}^{-}\|_{2}},
\]
(3)
这是激活加法(26(https://arxiv.org/html/2608.12892#bib.bib10);22(https://arxiv.org/html/2608.12892#bib.bib11))的多示例类比。
#### 线性与逻辑探针。
归一化的分类器权重提供有监督判别方向,而无需非线性特征学习。
#### RFM/AGOP 方向。
递归特征机通过平均梯度外积估计任务适应的几何结构(21(https://arxiv.org/html/2608.12892#bib.bib15))。其主特征向量提供了一个低秩方向,而谱、集中度和对齐度统计量成为几何特征。一项 top-\(k\) 边界研究检验更宽的有监督子空间是否以选择性换取杠杆作用。
所有方向均按记录和层独立拟合,并在评估时注入选定的残差块。详细的激活提取、拟合超参数、推理设置和延续评分包含在已发布的协议中。
### 4.2 预测证据与分组评估
静态定位 \(L\) 总结类别分离、投影、显著性和方向一致性;RFM 几何 \(G\) 总结谱集中度和对齐度。这些特征与基线信念 \(B\)、元数据 \(M\) 和低剂量响应 \(R\) 嵌套,使得方法身份或观测到的响应不会被错误归因于静态定位。
我们为目标、损伤和干净结果拟合类别平衡的逻辑回归和随机森林。五折评估将来自同一记录、数据集或域的所有路径分组,防止相关轨迹跨越训练–测试边界。我们在主文中报告发生率、AUROC 和平均精度;额外的分类和校准结果见附录。相似文章
PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction
PraMem proposes a paradigm shift for long-horizon behavior prediction by using a lengthy historical sequence as a resource to build experiential memory via practice, improving LLM performance on behavior prediction tasks.
在长期用户交互中个性化具身多模态大语言模型智能体
本文提出Polar,一种多模态记忆增强框架,用于在长期用户交互中个性化具身MLLM智能体,利用知识图谱和情景记忆从累积上下文中定位用户意图的实例。
循旧图而航:大模型后训练中静态机制定位的陷阱
本文通过证明由于微调期间神经电路的动态演变,静态机制定位并不充分,从而对大模型后训练中的“先定位后更新”范式提出了挑战。它引入了新的指标来分析电路的稳定性,并提出了在机制定位中需要预测性框架。
基于过程轨迹的未来行为策略早期预测
一种新的过程级潜变量模型(PLVM)通过跨任务的部分过程轨迹预测未来行为策略,并在PowerWash Simulator游戏数据中进行了验证。
Progressive Point Matching (8分钟阅读)
Progressive Point Matching (PPM) 是一个提出的框架,用于在强化学习中为 LLMs 的长期任务分配部分信用,通过将推理视为马尔可夫状态空间中的路径来解决稀疏结果奖励的低效性。