单令牌稀疏自编码器特征是否具有因果必要性?层深度与SAE家族效应

arXiv cs.LG 论文

摘要

本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。

arXiv:2607.20596v1 公告类型:新 摘要:稀疏自编码器(SAE)特征用于解释和引导大型语言模型,但一个特征的因果角色在不同SAE家族中是否稳定尚未得到检验。单令牌特征(激活于单个词汇项)提供了诊断性案例,其中真实情况允许直接比较。我们分析了六个模型和三个SAE家族中的390万个特征,使用全层深度的零消融。单令牌特征在解码器空间中聚集紧密度提高了4.7倍,并集中在早期层(GPT2-Small的层0;Gemma的L0-L4)。消融这些特征在208个全层条件中的178个中产生了Benjamini-Hochberg显著的对数几率降低,深度控制了损伤是向下游级联还是直接塑造输出。跨家族的因果差异超过了家族内的规模效应:在同一基础模型上,GemmaScope和BatchTopK特征保持因果锚定,而LlamaScope特征是局部冗余的。目标令牌的排名在相同消融后,96-98%的时间内恢复到基线2倍以内,并且在相同模型内进行受控激活函数比较会逆转符号,使得训练方法成为剩余候选因素。因此,跨家族的可解释性主张对训练方法敏感,而不仅仅是激活函数或规模。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:12

# 单token稀疏自编码器特征是否具有因果必要性?层深度与SAE家族效应

来源:https://arxiv.org/html/2607.20596

Seonglae Cho¹,², Zekun Wu¹,², Kleyton Da Costa¹, Rishi Kalra¹, Ilham Wicaksono¹, Adriano Koshiyama¹,²
¹Holistic AI
²伦敦大学学院

###### 摘要

稀疏自编码器\(SAE\)特征被用于解释和引导大型语言模型,然而一个特征的因果角色在不同SAE家族之间是否稳定尚未得到验证。激活于单一词汇项的单token特征提供了一个诊断案例,其中基准真相允许直接比较。我们使用全层深度的零消融,分析了跨越六个模型和三个SAE家族的3.9M个特征。单token特征在解码器空间中聚集紧密4.7倍,并集中在早期层(GPT2-Small中的Layer 0;Gemma中的L0-L4)。消融这些特征在208个全层条件中的178个中产生了Benjamini-Hochberg显著的logit减少,其中层深度控制着损伤是向下游级联还是直接塑造输出。跨家族因果差异超过了家族内规模效应:在同一基础模型上,GemmaScope和BatchTopK特征保持*因果锚定*,而LlamaScope特征则是*局部冗余*。目标token的排名在相同消融后恢复到基线的2倍范围内,概率为96-98%,且受控的激活函数比较在同一模型内反转符号,留下训练方案作为残余候选。因此,跨家族可解释性主张对训练方法敏感,而不仅仅是激活函数或规模。

# 单token稀疏自编码器特征是否具有因果必要性?层深度与SAE家族效应

## 1 引言

参见图注:图1:单token出现率与SAE家族效应。
(A) 解码器向量的主成分分析散点图(GPT2-Small L0):绿色=单token,灰色=多语义。
(B) 出现率与模型规模:GemmaScope/res-jb(蓝色)从1.48%下降至0.14%;LlamaScope(红色)接近零。无拟合线(n=3)。
(C) 在8-9B规模上,GemmaScope出现率比LlamaScope高46倍(Gemma-2-9B vs Llama-3.1-8B)。

在同一个基础模型上,在一个稀疏自编码器\(SAE\)家族下消融后破坏目标token的特征,在另一个家族下几乎可以立即被替代,这使得跨家族的可解释性主张依赖于所使用的SAE。我们研究**单token特征**,即激活于一个词汇项及其形态变体的特征,作为“祖母细胞”的SAE模拟(Gross, 2002 (https://arxiv.org/html/2607.20596#bib.bib22)):单语义-多语义谱系的诊断端点,在此端点词汇级别的基准真相允许直接的跨家族比较。三个理由促成了这一聚焦:(i) 单token特征是具有词汇级基准真相的*诊断案例*,能够直接验证;(ii) 它们形成嵌入空间与特征空间之间可测量的*桥梁*,嵌入对齐度比多语义特征高1.72倍,且p<10⁻⁴²;(iii) 对于需要基于token身份方向进行引导和编辑的token级可靠性任务,它们具有*实际相关性*。

我们分析了来自Neuronpedia的3.9M个SAE特征(Lin and Bloom, 2023 (https://arxiv.org/html/2607.20596#bib.bib33)),涵盖六个模型:GPT2-Small (124M)(Radford et al., 2019 (https://arxiv.org/html/2607.20596#bib.bib44); Bloom, 2024 (https://arxiv.org/html/2607.20596#bib.bib5))、Gemma-2-2B和Gemma-2-9B(Team et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib48); Lieberum et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib32))、Gemma-3-1B(Gemma Team, 2025 (https://arxiv.org/html/2607.20596#bib.bib19))、Llama-3.1-8B(Grattafiori et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib21))以及DeepSeek-R1-8B(Guo et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib23))。这些跨越三个SAE家族:GemmaScope/res-jb、LlamaScope以及社区BatchTopK。该集合涵盖了近两个数量级的规模变化。

我们的分析得出两个主要发现。首先,单token特征在几何和因果上是独特的。它们集中在Layer 0(GPT2-Small中占91%),在解码器空间中聚集紧密4.7倍,并展现出尖锐的L0至L1过渡,格拉斯曼对齐度为0.26,而后续层则大于0.9。这些特征在层间的持续存在度比多语义特征高2.7倍,p<10⁻⁷³。对七个全深度模型×SAE配置的因果消融证实了在测量读数下零消融的必要性:208层中有178层达到BH显著。其次,跨SAE家族差异超过了家族内规模效应。LlamaScope SAE在可比8-9B规模下的出现率比GemmaScope低46倍,且在同一基础模型上基于token匹配的比较将这一差距扩展到了因果结构:GemmaScope和BatchTopK特征是因果锚定的,而LlamaScope特征是局部冗余的,在96-98%的时间里恢复其消融前的排名,尽管激活函数本身并不能解释这一点(第5节 (https://arxiv.org/html/2607.20596#S5))。我们额外观察到因果重要性随层深度和语义类别变化。单token特征是基准真相明确且跨家族匹配精确的端点;如果因果角色在这个最简单的匹配案例上就已出现分歧,那么对更复杂特征的比较——建立对应关系本身就是有争议的——很可能至少继承这种不稳定性,这是一个范围论证而非已证明的边界。要点:特征的因果必要性是真实的,但不能假定其可跨SAE家族移植;应将SAE家族视为需检查的实验变量,而非可抽象掉的细节。

## 2 相关工作

#### SAE可解释性基础。
稀疏自编码器在叠加假设下将神经激活分解为可解释特征(Elhage et al., 2022 (https://arxiv.org/html/2607.20596#bib.bib14); Bricken et al., 2023 (https://arxiv.org/html/2607.20596#bib.bib8); Cunningham et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib13); Shu et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib47))。大规模单语义特征涵盖从命名实体到句法模式和抽象概念的范围(Templeton et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib49); Gao et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib17))。SAE特征服务于下游的引导、电路分析和模型编辑管道(Marks et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib38); Chalnev et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib10); Arad et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib2)),使得跨家族稳定性具有实际重要性。

#### 跨方法评估与特征通用性。
SAE恢复的特征依赖于架构选择以及用于评估它们的指标(Leask et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib29); Locatello et al., 2019 (https://arxiv.org/html/2607.20596#bib.bib35); Karvonen et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib26); Korznikov et al., 2026 (https://arxiv.org/html/2607.20596#bib.bib27))。近期工作追踪特征在层间的演化(Balcells et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib4); Balagansky et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib3); Olah et al., 2020 (https://arxiv.org/html/2607.20596#bib.bib40); Elhage et al., 2021 (https://arxiv.org/html/2607.20596#bib.bib15))并测试跨模型通用性(Lan et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib28); Paulo and Belrose, 2025 (https://arxiv.org/html/2607.20596#bib.bib43); Chanin et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib12))。

## 3 方法

参见图注:图2:三向验证。
(A) 检测示意图:激活度量和解码器几何。
(B) 差距比率与词汇纯度将单token(绿色)与多语义(灰色)分开。
(C) GPT2-Small Layer 0上的解码器几何聚类:单token解码器向量的平均成对余弦比严格多语义集合(差距<0.2,纯度<0.4,在top-10读取)紧凑7.5倍。在整个论文使用的规范操作点(top-20,全多语义补集)下,比例为4.7倍(表2 (https://arxiv.org/html/2607.20596#S3.T2))。

### 3.1 数据与模型

我们分析在Neuronpedia上托管的预训练SAE(Lin and Bloom, 2023 (https://arxiv.org/html/2607.20596#bib.bib33)),涵盖六个模型,跨越三个SAE家族(表1 (https://arxiv.org/html/2607.20596#S3.T1))。所有SAE检查点、激活数据和特征解释均可公开获取。对于每个特征,我们使用:(i) 来自SAE检查点的解码器向量\(\boldsymbol{w}_{\text{dec}}\in\mathbb{R}^d\)(Chanin and Bloom, 2024 (https://arxiv.org/html/2607.20596#bib.bib11)),(ii) 前k个激活token及其值,以及(iii) 自动可解释性解释。GPT2-Small使用res-jb SAEs(Bloom, 2024 (https://arxiv.org/html/2607.20596#bib.bib5))。Gemma-2和Gemma-3模型使用GemmaScope JumpReLU SAEs(Lieberum et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib32); Rajamanoharan et al., 2024b (https://arxiv.org/html/2607.20596#bib.bib46), a (https://arxiv.org/html/2607.20596#bib.bib45))。Llama-3.1和DeepSeek-R1使用LlamaScope TopK SAEs(He et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib24); Gao et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib17)),遵循k-稀疏自编码器框架(Makhzani and Frey, 2014 (https://arxiv.org/html/2607.20596#bib.bib37))。对于因果实验,我们额外在Gemma-2-2B和Gemma-3-1B上使用社区BatchTopK SAEs(Bussmann et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib9); Chanin and Bloom, 2024 (https://arxiv.org/html/2607.20596#bib.bib11)),以在相同基础模型上比较竞争性与独立性激活函数。

表1:分析的模型与SAE配置。SAE家族反映了训练方法。

### 3.2 单token检测

我们将**单token特征**定义为激活由单个词汇项及其形态变体主导的特征。我们使用从前k=20个激活token计算出的三个连续指标来操作化这一概念:
**差距比率**衡量顶部token的主导程度:\(\text{gap} = (v_1 - v_2) / v_1\),(1)
其中\(v_1 \geq v_2\)是前k个激活token中前两个激活值。
**词汇纯度**衡量前k个位置中被最频繁token及其大小写变体占据的比例:\(\text{purity} = \max_t |\{ i \in [k] : t_i = t \}| / k\),(2)
经过大小写归一化后,其中\(t_i\)是第i个顶部激活token的表面形式,最大值取自在top-k集中出现的所有唯一token\(t\)。
**完整词**要求有词边界前缀(BPE使用空格,SentencePiece使用U+2581),排除子词片段。

我们选择操作点为差距≥0.3,纯度≥0.6,以及完整词(表2 (https://arxiv.org/html/2607.20596#S3.T2)中加粗行),该操作点由三个独立信号验证:64%的解释匹配度、4.7倍的几何聚类以及消融下的因果必要性。该操作点是保守的:在Dirichlet零假设(α=1.0)下,对k=20个token,99分位差距比率为0.77,将我们的阈值置于零假设尾部之下;三个标准的结合将检测限制在特征的1.48%。所有定性发现在2倍阈值范围内稳健(表2 (https://arxiv.org/html/2607.20596#S3.T2)),并且我们的因果实验(第4.5节 (https://arxiv.org/html/2607.20596#S4.SS5))使用独立的、基于百分位的解码器对齐方法。

**出现率**是单token数量除以每层特征数;对于GPT2-Small,总体为364/24,576 = 1.48%,其中91%在Layer 0。

表2:检测阈值与验证(GPT2-Small,24,576个特征/层×12层)。
†解释匹配度:特征其Neuronpedia自动可解释性解释包含字面顶部激活token的比例。

### 3.3 解码器对齐检测

基于激活的检测在LlamaScope特征中发现近乎为零,因为TopK到JumpReLU的转换改变了激活分布。对于需要跨家族检测的因果实验,我们使用**解码器对齐检测**:每个解码器向量\(\boldsymbol{w}_i^{\text{dec}}\)与模型token嵌入矩阵\(\mathbf{E}\)之间的余弦相似度,应用相同的差距和纯度阈值。此方法不需要激活数据。两种方法在适用范围内一致:单token特征的平均余弦为0.67,且第4节中logit镜头顶部token匹配率为89%。作为直接的LlamaScope检查,在32层中所有2,872个解码器对齐的单token特征在4,096个评估序列中至少在其假定token上激活一次,其中88.3%在消融时显示负Δlogit,69.7%超过|Δlogit|>0.1。

### 3.4 几何分析

我们使用解码器向量\(\{\boldsymbol{w}_i\}_{i\in\mathcal{F}}\)的三个指标来表征特征几何:

**类型内相似度**。对于特征子集\(\mathcal{F}\)(解码器向量\(\{\boldsymbol{w}_i\}_{i\in\mathcal{F}}\)),
\(\text{sim}_{\text{within}}(\mathcal{F}) = \frac{2}{|\mathcal{F}|(|\mathcal{F}|-1)} \sum_{i<j} \cos(\boldsymbol{w}_i, \boldsymbol{w}_j)\),(3)
余弦值较高表示单token聚类更紧密。

**本征维度**。我们使用Levina-Bickel最大似然估计的池化平均变体(Levina and Bickel, 2004 (https://arxiv.org/html/2607.20596#bib.bib30)):
\(\hat{d} = \left[ \frac{1}{n(k_{\text{ID}}-1)} \sum_{i=1}^n \sum_{j=1}^{k_{\text{ID}}-1} \log \frac{r_{k_{\text{ID}}}(\boldsymbol{w}_i)}{r_j(\boldsymbol{w}_i)} \right]^{-1}\),(4)
其中\(n=|\mathcal{F}|\),\(k_{\text{ID}}=10\)个最近邻(与检测top-k=20不同),\(j\)索引最近邻排名1至\(k_{\text{ID}}-1\),\(r_j(\boldsymbol{w}_i)\)为\(\boldsymbol{w}_i\)到其在\(\mathcal{F}\)中第j个最近邻的欧几里得距离。

**跨层格拉斯曼对齐**。设\(U_\ell, U_{\ell+1} \in \mathbb{R}^{d \times d_{\text{PCA}}}\)具有正交列,覆盖相邻层解码器矩阵的前\(d_{\text{PCA}}=50\)个主成分子空间(Balagansky et al., 2025 (https://arxiv.org/html/2607.20596#bib.bib3); Lindsey et al., 2024 (https://arxiv.org/html/2607.20596#bib.bib34))。对齐度为
\(\text{align}(\ell, \ell+1) = \frac{1}{d_{\text{PCA}}} \sum_{i=1}^{d_{\text{PCA}}} \cos(\theta_i)\),(5)
其中\(\{\theta_i\}_{i=1}^{d_{\text{PCA}}}\)来自\(U_\ell^\top U_{\ell+1}\)的奇异值分解的主角,等价于奇异值\(\sigma_i(U_\ell^\top U_{\ell+1}) = \cos(\theta_i)\)。相同子空间的值接近1,正交子空间(表示变换下)的值接近0。

## 4 结果

表3 (https://arxiv.org/html/2607.20596#S4.T3)将每个主要经验主张映射到其模型集、检测器,

相似文章

用于特征发现与长上下文归因的回合平均SAEs

arXiv cs.CL

本文介绍了基于回合平均的稀疏自编码器(SAEs),该编码器基于对话回合的平均激活值运行,能够实现长上下文的高效特征发现与归因图。此外,本文还提出了一种嵌套架构,用于与每个词元的特征联合训练。

WriteSAE:面向循环状态的稀疏自编码器

Hugging Face Daily Papers

WriteSAE 引入了第一个稀疏自编码器,能够分解状态空间模型和混合循环语言模型中的矩阵缓存写入,相比现有方法实现了更优的令牌级干预。