稀疏读出棱镜:通过特征而非令牌解释Logit透镜分数

arXiv cs.CL 论文

摘要

本文提出Sparse Readout Prism(SRP),该方法通过将读出矩阵分解为稀疏特征来分析语言模型的预测,实现了与语料库无关的Logit透镜分数解释,并提升了可解释性。

arXiv:2609.01936v1 Announce Type: new 摘要:语言模型对下一个令牌的预测在各层中逐步发展,透镜方法通过将中间隐藏状态解码为令牌来跟踪这一过程。然而,透镜读数反映了隐藏状态和用于解码它的读出(即反嵌入矩阵)。许多透镜是在语料库上拟合的,我们表明,仅拟合语料库不同的两个透镜可能对相同的隐藏状态报告不同的令牌。我们将这种依赖称为语料库条件性。为了独立于拟合语料库来检查读出结构,我们引入了Sparse Readout Prism(SRP),它仅使用权重分解读出,并将任何令牌logit或logit差异表示为稀疏读出特征贡献的总和。这揭示了读出特征作为透镜读数的新分析单位,暴露了令牌身份可能掩盖的结构,并使得跨令牌、上下文、层和透镜的比较成为可能。将原始读出替换为SRP的稀疏近似,重建了比基于读出行几何关系的六个基线中最强者多8.9至17.3个百分点的测试logit差异。消融特征与其SRP贡献成比例地改变logit差异。尽管令牌读数随拟合语料库而变化,但主导读出特征保持稳定。由于SRP在构建中不使用任何语料库,它为透镜分析提供了一个独立于拟合语料库的控制。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:49

# 以特征而非令牌解释对数几率透镜分数
来源:https://arxiv.org/html/2609.01936

## 稀疏读出棱镜:以特征而非令牌解释对数几率透镜分数
邱新驰,Nicholas D·莱恩
剑桥大学计算机科学与技术系

###### 摘要
语言模型对其下一个令牌的预测在各层间发展,透镜方法通过将中间隐藏状态解码为令牌来跟踪这一过程。然而,透镜的读数既反映了隐藏状态,也反映了解码时使用的读出(即嵌入矩阵)。许多透镜是在语料库上训练的,我们表明,仅训练语料库不同的两个透镜,对相同的隐藏状态可能报告不同的令牌。我们将此依赖性称为“语料库条件性”。为了独立于训练语料库考察读出结构,我们引入了稀疏读出棱镜(SRP),它仅使用权重分解读出,并将任何令牌对数几率或对数几率差异表示为稀疏读出特征贡献之和。这揭示了读出特征作为透镜读数的一个新分析单元,暴露了令牌身份可能掩盖的结构,并使得跨令牌、上下文、层次和透镜的比较成为可能。用SRP的稀疏近似替代原始读出,在测试的对数几率差异重建上,比基于读出行几何关系的六个基线中最强者多重建了8.9到17.3个百分点。消融特征会按其SRP贡献比例改变对数几率差异。虽然令牌读数随训练语料库而变化,但主导读出特征保持稳定。由于SRP在其构建中不使用任何语料库,它为透镜分析提供了一个独立于训练语料库的对照控制。

## 1引言
图1:透镜读数的来源。
(A) 在提示“The programmer reproduced the crash and filed a”上,Qwen3.5-2B 对 “bug” 相对于 “insect” 的对数几率透镜分数。
(B) SRP 将该差值分解为带符号的读出特征贡献,以对数几率单位表示。主要特征都与软件缺陷有关,其中没有昆虫含义的特征。条形给出了每个特征的ID以及语言模型头中在其上得分最高的行,其中几行是非英语的(§5 (https://arxiv.org/html/2609.01936#S5))。小项和令牌形式项(大小写、空格和标点变体)被隐藏。总和与残差使用了完整的分解。

在Transformer语言模型中,每个输出对数几率是呈现给语言模型头的归一化最终状态与嵌入矩阵WU(也称为LM头)的一行之间的点积。我们将此矩阵称为读出,因为模型仅从最终状态中读出其预测。然而,更早层的状态已经携带了关于最终输出的信息。透镜式方法(nostalgebraist, 2020 (https://arxiv.org/html/2609.01936#bib.bib53); Belrose et al., 2023 (https://arxiv.org/html/2609.01936#bib.bib3); Pal et al., 2023 (https://arxiv.org/html/2609.01936#bib.bib55); Ghandeharioun et al., 2024 (https://arxiv.org/html/2609.01936#bib.bib24))利用这一点,通过相同的读出来解码这些状态,从而跟踪信息如何累积。这些读数常被用作背后计算的证据,例如当主要出现英语令牌时被解释为英语的中间工作语言(Wendler et al., 2024 (https://arxiv.org/html/2609.01936#bib.bib75); Schut et al., 2025 (https://arxiv.org/html/2609.01936#bib.bib67))。

对数几率透镜直接使用WU,而经过训练的透镜,如调谐透镜(Belrose et al., 2023 (https://arxiv.org/html/2609.01936#bib.bib3))和雅可比透镜(Gurnee et al., 2026 (https://arxiv.org/html/2609.01936#bib.bib28)),首先通过从语料库估计的映射将状态转移到LM头读取的空间。在任何一种情况下,透镜都显示哪些令牌获得高分。将这些分数解释为中间计算的证据,就是将令牌身份视为状态被解码的读出结构的代理。

图1 (https://arxiv.org/html/2609.01936#S1.F1) 说明了为什么这种代理是模糊的。对数几率透镜在关于软件的提示上对“bug”的评分高于“insect”,但“bug”的每个含义共享LM头的同一行,因此仅凭分数无法区分软件缺陷和昆虫。相反,近义词和翻译对应词占据不同的行,但可能共享主导方向,因此不同的令牌可以报告相同的底层结构。令牌身份对于区分同一令牌的不同含义过于粗糙,对于识别跨令牌共享的结构又过于精细。

对于经过训练的透镜,第二个模糊性在于其输出可能反映训练语料库以及状态。我们发现,在英语和中文上训练的透镜对相同固定状态报告不同的语言(§5 (https://arxiv.org/html/2609.01936#S5))。因此,从报告的令牌推断工作语言是不确定的。

我们引入了稀疏读出棱镜(SRP),它改变了透镜报告的内容——从令牌身份变为读出特征——同时保持其传输状态的方式不变。这些特征为透镜读数揭示了一个新的分析单元,暴露了令牌身份可能掩盖的读出结构。因为它们构建自每个透镜共享的读出,所以也支持跨令牌、上下文、层次和透镜的比较。SRP直接将字典学习应用于读出的行,将每一行表示为共享过完备基上的稀疏系数加上残差,而读出特征是该基的一个方向。一行可以包含多个特征,一个特征可以出现在许多行中,因此这些特征描述了读出本身的组织方式。透镜通过读出的某一行给一个令牌评分,并通过两个令牌行的差值给它们之间的差值评分,因此以这种方式表示每一行后,分数就被分解为每个特征的带符号贡献加上残差(§3.2 (https://arxiv.org/html/2609.01936#S3.SS2))。

SRP在单一令牌内解决了图1 (https://arxiv.org/html/2609.01936#S1.F1) 中“bug”的歧义。在软件语境中,支持“bug”的差值依赖于缺陷特征,而在昆虫语境中,同一令牌的支持来自动物含义的特征(图3 (https://arxiv.org/html/2609.01936#S4.F3))。跨透镜分析则处理了相反的情况,即相同的读出特征携带不同的报告令牌(§5 (https://arxiv.org/html/2609.01936#S5))。

本文有两项贡献,一项方法论,一项实证。
1.  SRP(§3 (https://arxiv.org/html/2609.01936#S3))为每个模型提供一个基,从读出权重中拟合一次,供每个透镜和层共享。与基于行几何关系的六个基线中最强者相比,它在测试的对数几率差异重建上多重建了8.9到17.3个百分点,并且消融一个特征会按其贡献比例改变分数(§4 (https://arxiv.org/html/2609.01936#S4))。
2.  我们表明,经过训练的透镜的报告取决于其训练所用的语料库,这种依赖性我们称之为语料库条件性。改变雅可比透镜的训练语料库会改变其对相同隐藏状态报告的语言,而主导读出特征在不同训练语言、两种透镜构造以及当比较语言共享文字时都保持稳定。因此,该基将状态的变化与工具的变化分离(§5 (https://arxiv.org/html/2609.01936#S5))。

综合来看,这些结果提醒我们不要将令牌排名视为中间计算的直接证据。它们也提供了这种推断所需的控制,一个在进行任何读数之前就固定在权重中的参考。

## 2相关工作
#### 透镜式方法。对数几率透镜直接应用未嵌入矩阵(nostalgebraist, 2020 (https://arxiv.org/html/2609.01936#bib.bib53)),而调谐透镜、未来透镜、补丁透镜和雅可比透镜则首先学习或传输映射(Belrose et al., 2023 (https://arxiv.org/html/2609.01936#bib.bib3); Pal et al., 2023 (https://arxiv.org/html/2609.01936#bib.bib55); Ghandeharioun et al., 2024 (https://arxiv.org/html/2609.01936#bib.bib24); Gurnee et al., 2026 (https://arxiv.org/html/2609.01936#bib.bib28))。它们都以令牌身份报告,而SRP改变了该单位而不改变透镜,因此不同训练方式的透镜可以在相同状态上进行比较(§5 (https://arxiv.org/html/2609.01936#S5))。

#### 输出几何与稀疏行字典。权重绑定(Press and Wolf, 2017 (https://arxiv.org/html/2609.01936#bib.bib61); Inan et al., 2017 (https://arxiv.org/html/2609.01936#bib.bib33); Lopardo et al., 2026 (https://arxiv.org/html/2609.01936#bib.bib44))、Softmax和目标几何(Yang et al., 2018a (https://arxiv.org/html/2609.01936#bib.bib77); Zhao et al., 2024 (https://arxiv.org/html/2609.01936#bib.bib80))以及分词器分割(Bostrom and Durrett, 2020 (https://arxiv.org/html/2609.01936#bib.bib5))赋予了未嵌入行共享的结构。对静态词嵌入的稀疏编码从类型层面的行中恢复出可解释的码(Murphy et al., 2012 (https://arxiv.org/html/2609.01936#bib.bib51); Faruqui et al., 2015 (https://arxiv.org/html/2609.01936#bib.bib19); Subramanian et al., 2018 (https://arxiv.org/html/2609.01936#bib.bib71); Arora et al., 2018 (https://arxiv.org/html/2609.01936#bib.bib2))。SRP将这种方法应用到训练好的Transformer的LM头的行上,通过替换和所选分数的重建来判断。行邻域、聚类和主方向总结了相同的行,但没有一个被约束为与所分析的对数几率或差值之和相等。SRP在设计上满足该约束,§4.2 (https://arxiv.org/html/2609.01936#S4.SS2) 测量了每种方法恢复了多少所选分数。

#### 激活SAE与参数空间分解。据我们所知,稀疏自编码器(SAE)之前从未被拟合到训练好的Transformer的静态权重,只被拟合到其激活。这两种拟合分解了相同分数的相反因子,因为透镜分数的形式为h̃_ℓ^⊤ q,即解码状态与读出方向q的点积。激活SAE为解码状态背后的隐藏状态h_ℓ学习每层一个过完备基(Bricken et al., 2023 (https://arxiv.org/html/2609.01936#bib.bib7); Huben et al., 2024 (https://arxiv.org/html/2609.01936#bib.bib31); Gao et al., 2025a (https://arxiv.org/html/2609.01936#bib.bib21); Templeton et al., 2024 (https://arxiv.org/html/2609.01936#bib.bib72)),而SRP将相同的机制应用于q本身,拟合一个服务于每个透镜和层的基。激活SAE也依赖于产生其隐藏状态的语料库,因此通过其基来判断一个透镜读数相对于另一个读数,将引入第三个依赖于语料库的工具。§5 (https://arxiv.org/html/2609.01936#S5) 的跨透镜分析则需要一个不随透镜、提示或语料库而移动的参考。参数空间分解也分解权重(Braun et al., 2025 (https://arxiv.org/html/2609.01936#bib.bib6); Gao et al., 2025b (https://arxiv.org/html/2609.01936#bib.bib22)),而SRP将其分解与透镜读取的分数联系起来。附录P (https://arxiv.org/html/2609.01936#A16) 扩展了本节,包括透镜变体、稀疏特征基础设施、潜在语言的读数、输出空间的几何以及对机制的归因。

## 3稀疏读出棱镜
无论分数是一个令牌的对数几率还是两个令牌之间的差值,透镜都以令牌身份报告它,而SRP将相同的分数解析为推动其上升或下降的读出特征及其幅度(图2 (https://arxiv.org/html/2609.01936#S3.F2))。这些特征来自从LM头行学习的稀疏字典(§3.1 (https://arxiv.org/html/2609.01936#S3.SS1))。贡献和一个显式残差精确求和得到分数(§3.2 (https://arxiv.org/html/2609.01936#S3.SS2)),一个固定的字典使跨上下文、层次和透镜的分解可比较(§3.3 (https://arxiv.org/html/2609.01936#S3.SS3)),保真度诊断伴随每次分解(§3.4 (https://arxiv.org/html/2609.01936#S3.SS4))。

全文中,h_ℓ ∈ ℝ^{d_model} 表示在透镜解码之前的ℓ层隐藏状态,d_model 是模型隐藏状态的维度。每个透镜应用一个映射 T_ℓ,涵盖了透镜在未嵌入之前的所有操作,即模型的固定输出归一化与透镜添加的任何传输的组合,按透镜应用的顺序。对数几率透镜不添加传输,因此其映射仅是该归一化,即模型的最终LayerNorm或RMSNorm,并且每个透镜在最终层ℓ = L时都归结为相同的映射。当 T_ℓ 携带从数据估计的参数时,透镜就是训练过的。调谐透镜添加它拟合的仿射翻译器,而§5 (https://arxiv.org/html/2609.01936#S5) 中比较的雅可比透镜添加在语料库上拟合的平均雅可比矩阵。我们用 h̃_ℓ = T_ℓ(h_ℓ) ∈ ℝ^{d_model} 表示呈现给LM头的解码状态。然后,在词汇表 𝒱 上的嵌入矩阵 WU ∈ ℝ^{|𝒱| × d_model} 产生对数几率 WU h̃_ℓ。行 v,写为列向量 w_v := WU[v, :]^⊤,给令牌 v 线性分数 logit_v(h̃_ℓ) = h̃_ℓ^⊤ w_v。Gemma 在此线性分数后应用非线性对数几率软上限,附录F (https://arxiv.org/html/2609.01936#A6) 单独处理该软上限。SRP 仅分解 WU,透镜只改变被行评分的解码状态。参考图例:

图2:稀疏读出棱镜,示意图。
左:对于未嵌入行上的系数α,SRP将选定的读出方向q_α分解为带符号的特征方向d_i β_i(α)和残差r_α。
右:对于解码状态h̃_ℓ,分数s_α(h̃_ℓ)分解为每个特征的贡献和 h̃_ℓ^⊤ r_α,全部以对数几率单位表示。蓝色条支持A,橙色条支持B,阴影标记残差(§3.2 (https://arxiv.org/html/2609.01936#S3.SS2))。

### 3.1 将LM头分解为稀疏读出特征
SRP 对 WU 的行应用稀疏自编码器(Bricken et al., 2023 (https://arxiv.org/html/2609.01936#bib.bib7); Huben et al., 2024 (https://arxiv.org/html/2609.01936#bib.bib31); Gao et al., 2025a (https://arxiv.org/html/2609.01936#bib.bib21))。然后每一行分解为 w_v = ŵ_v + r_v,其中 ŵ_v = μ + ∑_{i=1}^{D} z_{v,i} d_i,ŵ_v 是拟合的行,r_v 是残差,μ 是共享偏移,D 是字典宽度,d_i ∈ ℝ^{d_model} 是读出特征方向,z_{v,i} 是行 v 在特征 i 上的稀疏系数。用SAE的术语,μ 是解码器偏置,d_i 是解码器方向。我们将此字典称为读出SAE。固定读出特征方向 d_i 后,投影 p_i(h̃_ℓ) = h̃_ℓ^⊤ d_i 给出解码状态在特征 i 上的分数。

相似文章

Query Lens:利用间接效应解释稀疏键值特征

arXiv cs.LG

Query Lens 扩展了 Logit Lens,通过联合考虑编码器侧的键特征和解码器侧的值特征,并计入来自下游模块的间接效应,来解释稀疏自编码器特征。该论文还提出了子空间通道假说,表明下游模块通过特定层的子空间读取特征。

短视域与稀疏概念:J-lens读取的数学视角

arXiv cs.CL

本文对雅可比镜头(J-lens)用于从语言模型中读取可语言化表示进行了数学分析,识别了其稀疏因果几何结构,并提出了改进措施以增强概念读取能力。

原型语言模型

arXiv cs.LG

介绍了PRISM,一种原型语言模型架构,它使用稀疏、非负的已学习原型混合体进行可解释的序列建模,实现了具有竞争力的性能,并支持快速训练数据归因和无需微调的模型编辑。

大规模解读语言模型隐藏状态

arXiv cs.AI

OmniLens是一种可扩展的透镜方法,用于解读LLM隐藏状态,通过低秩转换器和Subset-KL减少参数与内存,使得在LLaMA-3.3-70B上能够以显著更低的成本构建包含482个透镜的密集集成。