对比投影:通过差分逻辑透镜读取Transformer内部状态

arXiv cs.CL 论文

摘要

本文介绍了一种对比投影技术,通过差分配对提示的逻辑透镜来读取Transformer内部状态,从而能够识别不同架构(如Phi-2)中计算特有的差异。

arXiv:2609.09902v1 Announce Type: new Abstract: 读取Transformer在令牌空间中的内部状态既简单又难以信任:单个隐藏状态上的逻辑透镜在中间层主要由模型对几乎任何输入都会预测的通用令牌主导。我们改为读取差异。减去两个紧密匹配提示的隐藏状态并通过解嵌入投影,可以取消共享部分并突显它们之间的差异,这一操作等同于通过逻辑透镜读取RepE/ActAdd引导向量。将其内置到一个无需训练的追踪器中,该追踪器在每个位置、子层和头处读取,并在设计的基线上取平均值,它在Phi-2中追踪了一个复合名词MLP->注意力链,通过激活修补得到确认,并且通过读出和探测在三个架构中恢复了相同的区分,而不是通过修补;它读取了检索为真实与虚构实体所呈现的内容,并将隐喻读取为一组领域到领域的映射,而不是单一的比喻特征。一个跨种子对照标记了边界:在五个仅初始化不同的网络中,相同的区分以几乎完全不同的令牌出现(前10重叠0.08)。计算在令牌空间中的外观是网络特定的;它所绘制的区分则不是。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:16

# 通过差分逻辑镜头解读Transformer内部机制
来源:https://arxiv.org/html/2609.09902

## 对比投影:通过差分逻辑镜头解读Transformer内部机制

###### 摘要
在令牌空间中读取Transformer的内部状态既容易又难以信任:对单个隐藏状态施加的逻辑镜头,在中间层往往会被模型对几乎任何输入都会预测的通用令牌所主导。我们转而解读其差异。通过对两个匹配提示的隐藏状态进行相减并通过非嵌入矩阵投影,可以抵消共有成分并突显区分特征——这一操作等效于通过逻辑镜头读取RepE/ActAdd引导向量。该方法被整合到一个无需训练的追踪器中,可在每个位置、子层和注意力头进行读取,并基于设计的基线进行平均,用于追踪Phi-2中复合名词的MLP→注意力链路(通过激活补丁确认),同时通过读取和探针而非补丁技术,在三个不同架构中复现了相同区别特征;该方法能读取检索机制如何区分真实实体与虚构实体,并将隐喻解读为领域间的映射集合而非单一的比喻特征。跨种子对照实验划定了边界:在仅初始化不同的五个网络中,相同的区分特征几乎完全以不同的令牌形式呈现(前10重叠率0.08)。令牌空间中的计算表现具有网络特异性,但其区分特征并非如此。

## 1 引言
Transformer处理“热狗是”时会预测与食物相关的延续词。同一模型接收“冷狗是”时则预测与动物相关的延续词。逻辑镜头将每个隐藏状态投影通过权重矩阵WU。但单一输入的投影受制于强烈的共享信号:在中间层,两个输入读取到的都是相同的高频功能词(“不、没有、制造、更多”),而非食物或动物内容(表1第一列)。在投影前用一个隐藏状态减去另一个,可以抵消共享信号并读取差异部分。“热狗−冷狗”的差值从第8层起能读取食物词汇(“油炸、酥脆、美味、风味”),这些词汇在任一组成的逻辑镜头前20名中均不存在(L24前重叠率为0-1/5)。反向对比“冷−热”则能突显动物词汇(“梳理、爪子、吠叫、品种”),这正是食物方向所取消的宠物解读。差异具有符号性:每个方向报告其承载而另一方缺失的特征。

两个匹配的输入共享大部分计算,因此通过相减保留下来的正是模型区别对待的成分。

表1:“热狗是”与“冷狗是”末尾令牌的初始对比解读(Phi-2)。任一输入的原始逻辑镜头在每层都读取高频功能词;热−冷差值读取食物词汇(从L8开始可辨识),冷−热差值读取动物词汇(到L20趋于清晰)。直接引用前3名;部分条目为子词片段(“nt、hors、euth”)或噪声(“Pent、ogie”)。

每次对比解读都是特定于输入对的,它报告分离特定提示对的特征。只改变一个变量的紧密配对比改变多个变量的松散配对读取更清晰。对比设计引导着读取方向:呈现的内容是选择而非发现的。这是一种机制性的对比解释形式,通过选择一个参照案例来解释为何某一情况而非另一情况会发生,参照案例固定了答案(van Fraassen, 1980; Lipton, 1990)。

这种基本方法并不新颖。对两个提示的隐藏状态进行差分并投影通过WU,正是表示工程或激活加法引导向量通过逻辑镜头读取的运算(Zou et al., 2023; Turner et al., 2023; nostalgebraist, 2020)。Du等人(2026)已使用过完全相同的操作,他们通过逻辑镜头解码激活差值来追踪R1式推理模型中的反思控制信号。我们的贡献在于将其发展为系统性的追踪方法:在每个位置和子层进行读取,并基于设计的基线进行平均,能够定位变化轴在令牌空间中首次变得清晰的位置,识别写入该特征的子层,并确定承载该特征的注意力头。

我们增加三项技术和一组应用:
1. **系统性轨迹读取**:逐位置追踪可定位区分特征首次出现的位置及其在不同位置间的流动。逐注意力头分解可识别承载该特征的注意力头。逐层读取可追踪内容从早期检测到最终预测的变化过程。
2. **多对比三角定位**:单一输入对会报告两个提示的所有差异方式(不仅限于目标轴),因此其读取结果可能难以解读。将目标与多个共享目标轴但共享偶然轴不同的基线进行对比,然后取平均,偶然轴会被抵消而共享轴得以保留(§2.7)。
3. **对比设计**:读取结果呈现的内容取决于输入对的构建方式。我们给出了匹配对比的规则:共享**前导语**以避免第一个令牌的大规模激活;在读取位置使用匹配的当前令牌,使差值反映内容而非令牌身份;以及匹配预测的下一个令牌以暴露中期和晚期计算(§2.5)。

我们将该方法应用于Phi-2(2.7B参数),并在三种架构(Phi-2、Pythia-1.4B和Qwen2.5-1.5B)上重新运行复合名词回路,以区分普遍性特征与模型特定特征(§3.2)。展示的案例是从数百次读取中精选的最具说明性的结果。

一个注意事项框定了后续内容:我们读取到的特定令牌(如“油炸”、“尼泊尔、西藏”、“美味”)仅为示例,并非稳定编码。跨种子对照实验(§6)表明,仅初始化不同的五个网络会将相同区分特征表现为几乎完全不同的令牌(前10重叠率0.08),而区分特征本身在每个种子中都成立。因此,应将令牌解读为某一网络中对比所分离特征的证据,而非规范词汇。

## 2 方法
### 2.1 对比投影
给定两个输入c和k:
1. 运行两个输入并在读取位置提取每层的隐藏状态:h_c[L]和h_k[L](L=0,...,N)。
2. 计算Δh[L] = h_c[L] − h_k[L]。
3. 投影:Δlogits[L] = Δh[L] · W_U^T。
4. 读取前K个最正向令牌(与输入c关联)和前K个最负向令牌(与输入k关联)。两个极点共同描述令牌空间中的对比。

无需拟合参数。选择包括输入对、读取位置和K值。输入应对齐:相同令牌长度、在相同索引读取,使位置相关结构(在旋转嵌入中较强)在差值中抵消而非泄漏到读取结果中。§2.5表明这在第一个令牌处最重要,该位置携带大规模激活。当不同长度的名称使精确对齐无法实现时(§5),我们不直接信任读取结果,而是通过长度匹配的控制进行验证。

**两个实用说明**:我们通过逻辑镜头(W_U)而非输入嵌入进行投影。残差流与输出空间对齐,通过W_E投影相同状态会返回噪声。我们还投影原始状态,绕过最终的层归一化(LN_f)。对于两个匹配状态的差值,学习到的偏移会相互抵消。逐维度重缩放保留了前5个令牌(平均余弦≈0.95,对比归一化投影),仅重排了排名尾部,不影响轴级读取。将LN_f的增益融入W_U(如TransformerLens的做法)是等效的。

### 2.2 逐位置读取
通过在每个位置读取对比结果,我们可追踪信息流:意义区分在哪个位置首次出现?是在不同的令牌本身,还是在其后续关注它的位置出现?

### 2.3 注意力与MLP分解
每个Transformer层向残差流添加两个成分:注意力输出和MLP输出。我们通过前向钩子捕获两者,并分别通过W_U进行投影。这可以直接从投影中读取每层中哪个成分写入了给定的内容区别,无需训练探针。

通过W_U投影MLP写入和注意力头写入是已知技术:逻辑镜头此前已被应用于各组件。对比分析的新颖之处在于,对两个匹配运行进行差分通常能揭示组件内部的结构,而原始组件级读取无法显示这一点。当单次运行的MLP或注意力头写入投影为令牌混汤时,两个运行在同一组件上的差值可解析为清晰可辨的区分特征,因为共有主体被抵消,分离两个输入的成分得以保留。

### 2.4 投影读取内容
对比投影通过W_U读取两个状态的差值。任一输入的原始逻辑镜头读取受两者共享信号的主导(通常是排名顶部的高频功能词)。相减抵消了共有成分,读取剩余部分。

W_U投影为残差流中的方向分配令牌标签。这些标签是否可解释取决于对比设计和层级。对于精心选择的对比,在可读层上,它们能命名两个输入之间的差异。许多其他投影会返回令牌混汤(§2.7)。

读取结果是对W_U的投影,而非计算的分解。与任何令牌方向都不对齐的差值成分不会出现,其从读取结果中缺失并非其在状态中不存在的证据(Tuomi, 2026)。我们的主张有限:对于精心选择的对比,部分差异成分投影为可辨识的令牌。

### 2.5 对比设计
读取结果呈现的内容取决于输入对的构建方式。三条规则使对比可读:共享前导语、匹配的当前令牌和匹配的预测下一个令牌。

#### 前导语
*前导语*是我们对对比变化前共享文本的称呼。早期令牌不宜放置对比,原因有二。其一可量化测量:第一个令牌携带大规模激活,残差范数约为其他位置的20倍(在L8处为941 vs ∼45),属于Sun等人(2026)描述的注意力汇结构。该位置的差值会被放大并主导读取,因此下文中的大小写不匹配极具破坏性。其二不会表现为范数差异。在模型文本处理的前几个令牌中,模型仍在适应文本的注册格式。无论原因为何,如此早期的差异即使范数正常也读取不够清晰:我们的裸提示与带前导语的读取在余弦相似度上仅为0.85(表2),更短的提示读取效果更差。因此规则是将对比变化放在几个令牌之后,此时读取最清晰。共享的几个普通令牌前导即可实现此目的。

表2:相同的可食性对比(热与冷),在三种框架下读取末尾令牌(下划线):两个提示均大写(匹配)、第二个提示首字母小写(不匹配)以及两者均置于共享前导语后(“My grandmother said that”)。*读取结果*是L20处的直接前3名;*食物*是该处最佳食物令牌排名;*cos*是L20差值方向与前导语读取的余弦相似度。不匹配将食物排名推后并旋转读取方向(→0.64,原为0.85);前导语最稳定地读取食物。不匹配仅影响中层读取:到L24三者均恢复清晰的食物读取。

为何不匹配有害?单独的大小写差异本身较大且不可读。“The”与“the”的纯对比(“The hot dog was” vs “the hot dog was”,其他词语相同)在L20处差值向量范数约为40,读取为无意义内容(“NEY, ENE”)。这些无意义内容占食物对比本身的很大比例(L20处范数约68),因此起始不匹配会将读取转向无意义内容。原因是位置而非大小写:第一个令牌上的任何差异都会产生相同效果。

规则如下:除目标外处处匹配提示,并将目标置于起始令牌之后数个位置,带有共享前导语。对于强词汇对比,前导语仅为优化:食物信号在晚期层仍能恢复,仅中层读取会变得模糊。

#### 匹配当前令牌
读取位置的令牌在早期层会被重度处理。该位置的偶然差异(即使近乎无意义)会增加大的表面成分,淹没目标差异。2×2设计可精确说明(表3):交叉情境(读*小说* vs 观看*讲座*)与末尾词的同义词(*boring* vs *dull*),读取相同的小说-讲座差异。当末尾词匹配时,两个极点从中层起干净地读取情境(表4):小说极点读取“小说、文学、读者”,讲座极点读取“讲座、研讨会、学生、视频”。当末尾词为同义词不匹配时,差异还携带boring-vs-dull交换。其在L1处的范数约大十倍(30 vs 3-5),交换的后缀形态(“ly, ed, ers, ing”)主导读取结果(表5)。情境被掩盖,仅在最终层(L30-32)才浮现(小说极点出现“读者”,讲座极点出现“视频、youtube”),即使如此仍混杂片段。

匹配当前令牌可清理读取结果。这就是为何本文轨迹在共享令牌位置(如“dog”和“was”)读取。相同规则适用于基线相减:选择以目标最终令牌结尾的片段可抵消当前令牌成分。

表3:用于当前令牌对比的提示设计...

相似文章

透过镜子:直接读写Transformer

arXiv cs.CL

这篇论文揭示,只有少量的Transformer组件对token预测是必要的,并引入了直接读写这些组件的方法,只需极少更改。

Transformer之药

Reddit r/ArtificialInteligence

对Transformer架构在大型语言模型之外广泛影响的反思,包括对语言学、遗传学和因果建模的潜在影响,并将其意义与哈伯-博世法相提并论。

大规模解读语言模型隐藏状态

arXiv cs.AI

OmniLens是一种可扩展的透镜方法,用于解读LLM隐藏状态,通过低秩转换器和Subset-KL减少参数与内存,使得在LLaMA-3.3-70B上能够以显著更低的成本构建包含482个透镜的密集集成。