大小不重要:余弦评分稀疏自编码器

arXiv cs.LG 论文

摘要

本文提出用余弦相似度与输入幅值的可学习组合替代稀疏自编码器中的内积评分,结果表明所得特征更具可解释性且与概念对齐,优化器始终偏好余弦而非内积。

arXiv:2606.15054v1 公告类型:新论文 摘要:稀疏自编码器(SAE)通过内积检测特征,因此特征的激活值同时取决于其方向对齐程度和输入范数。在BatchTopK机制下,高范数词元会同时抬高所有预激活值,无论内容对齐与否都会抢占字典槽位。这一问题之所以重要,是因为子层归一化已丢弃了评分所度量的幅值信息,导致编码器检测到了模型不读取的量。我们采用余弦相似度与输入幅值的可学习混合替代评分,让优化器自主决定使用多少范数;一种逐特征扩展方式允许每个特征独立决策。在这两种机制下,训练可自由恢复内积行为,但从未如此选择——没有任何特征选择超过半幅值依赖。在匹配的重建效果下,余弦编码器学习到的特征与人类可识别概念对齐的频率远高于标准方法,填满了被内积浪费在范数检测器上的字典槽位。通过梯度均衡的损失重加权几乎无法缩小差距,证实了前向传播评分几何是关键杠杆。该优势并非在所有任务或深度上都成立,但我们认为余弦评分应成为归一化表示字典学习的默认选择。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:37

# 大小无关紧要:余弦评分稀疏自编码器

来源:https://arxiv.org/html/2606.15054

###### 摘要

稀疏自编码器(Sparse autoencoders,SAEs)通过内积检测特征,因此特征的激活值同时取决于其方向对齐程度和输入的范数。在 BatchTopK 机制下,高范数的 token 会同时抬高所有预激活值,无论内容对齐如何,都会抢占字典插槽。这一点之所以重要,是因为子层归一化已经丢弃了评分所衡量的幅度,所以编码器检测的是模型不读取的量。我们将评分替换为余弦相似度与输入幅度的可学习混合,让优化器自行决定使用多少范数;一个每特征扩展版本允许每个特征独立决定范数依赖程度。在这两种模式下,训练都可以自由地恢复内积,但从未如此做,没有任何特征的范数依赖程度超过半幅度。在匹配重建的前提下,余弦编码器学习到的特征与人类可识别概念的对齐频率远高于标准编码器,填满了标准编码器浪费在范数检测器上的字典插槽。通过损失重加权来均衡梯度几乎无法缩小差距,这证实了前向传播评分的几何形状才是关键杠杆。这种优势并非在所有任务或深度上普遍存在,但我们认为,对于归一化表示的字典学习,余弦评分应成为默认选择。

**关键词:** 稀疏自编码器,机械可解释性,字典学习

## 1 引言

稀疏自编码器是机械可解释性中标准的字典学习工具 (Bricken et al., 2023;Cunningham et al., 2023;Gao et al., 2024;Bussmann et al., 2024;Karvonen et al., 2025)。一个训练好的 SAE 被解读为特征字典:如果特征 \(i\) 在激活值 \(x\) 上被激活,那么 \(x\) 被认为包含了对应解码器方向所代表的概念。这种解读依赖于编码器如何检测这些方向。标准规则是内积 \(\langle w_i, x \rangle\),因此特征的激活程度既正比于其与 \(x\) 的方向对齐,也正比于幅度 \(\|x\|\)。

请参见图1:

**图1:余弦编码器:架构与主要结果。**  
**左图:** 标准 SAE 编码器计算 \(\langle w_i, x_c \rangle\),将方向对齐与范数耦合。余弦编码器将 \(w_i\) 单位归一化,并将评分替换为 \(e^b \|x_c\|^a \cos(x_c, w_i) + b_{\mathrm{enc},i}\);\(a\) 在纯余弦(\(a=0\))和内积(\(a=1\))之间插值。  
**右图:** 匹配重建(\(FVE \approx 0.77\))下稀疏探测 top-1 提升 \(+14.9\%\)。训练将 \(a\) 推向约 \(0.26\),远离内积极限。Qwen3-8B L18,500M token,\(d_{\mathrm{sae}} = 65,536\)。

请参见图2:

**图2:余弦评分 SAE 在探测上胜出,因为标准特征在 token 范数上激活。**  
**(A)** 结果:八项任务的稀疏探测 top-1(Qwen3-8B L18,500M token,\(d_{\mathrm{sae}} = 65,536\),匹配 \(FVE \approx 0.77\))。每特征余弦在 7/8 任务上胜出;情感是唯一例外。  
**(B)** 原因:标准编码器的*未匹配*特征(那些在余弦字典中没有最近邻对应项的特征)在最高范数 token 四分位数上的激活次数是最低范数 token 的 \(22\times\),而余弦仅为 \(4.7\times\);它们编码的是幅度,而非内容。  
**(C)** 证实:在同样的高范数 token 上,标准 SAE 的重建范数是输入范数的 \(9.5\times\),而余弦保持在输入尺度附近(\(0.55\times\))。从评分中移除 \(\|x\|\) 因子可恢复内容编码特征。出处:附录 D.2。

请参见图3:

**图3:评分曲面几何。**  
每个面板绘制编码器预激活值 \(\|x_c\|^a \cos(x_c, w_i)\) 与对齐(x轴)和输入范数(y轴)的关系。黑色曲线连接等评分对。  
**左图:** \(a=1\)(内积);双曲线,高范数 token 的评分超过方向对齐更好但范数较低的 token。  
**中图:** \(a=0\)(余弦);垂直曲线,忽略范数。  
**右图:** 全局学习到的 \(a \approx 0.26\);轻微倾斜,接近余弦。  
**底部:** 在主要设置下每特征 \(a_i\) 的分布。

对于具有预子层归一化的 Transformer 来说,这是错误的评分几何。内积评分混合了内容对齐与 token 范数,但归一化在模型读取激活值之前就剥离了范数;编码器检测的是下游计算忽略的量。在 BatchTopK 选择 (Bussmann et al., 2024) 下,这种不匹配会加剧:单个批量级别的阈值决定了哪些特征被激活,高范数 token 将所有预激活值抬高过这个阈值,无论内容对齐如何,都占用了不成比例多的插槽。在训练过程中,这种选择压力会使内容编码特征匮乏:它们很少赢得 TopK 插槽,接收不到学习信号,因此永远无法发展。结果得到的是一个由基于幅度而非意义激活的特征主导的字典。这不是一个小标定问题。如果字典元素在范数而非内容上激活,它们就不能可靠地用于稀疏探测、特征引导操纵或电路分析;从业者将其解读为模型概念,但特征编码的是模型丢弃的量。与模型实际读取的内容一致的评分应依赖于方向,而非幅度。

我们将内积评分替换为通过输入范数上的可学习指数 \(a\) 缩放的余弦评分:
\[
s_i(x) = \|x\|^a \cdot \cos(x, w_i) + b_{\mathrm{enc},i},
\]
该评分在余弦(\(a=0\))和内积(\(a=1\))之间插值;我们使用单位归一化的编码器行,使得 \(a=0\) 能干净地恢复余弦(§3)¹。

¹ 直到一个可学习的全局温度;参见 §3。

我们研究两种参数设置:一个所有特征共享的全局 \(a\),以及一个每特征扩展 \(a_i = a_{\mathrm{base}} + \delta_i\),让每个特征学习自己的范数依赖。关键特性是,如果幅度确实有用,优化器可以自由地恢复内积(\(a=1\)),但不会默认被迫使用它。这使得训练能够发现正确的几何形状,而不是假定它。在这两种设置中,训练始终将 \(a\) 推向零;没有任何特征接近内积区域,证实方向(而非幅度)才是有用信号。通过 Qwen3-8B 和 Gemma-2-2B 上的实验,我们证明余弦评分 SAE 在重建保真度、模型行为保持和每特征可解释性方面匹配标准 BatchTopK,同时生成的字典与人类可识别的概念对齐频率高得多。一个匹配特征分解显示,探测差距的大部分并非来自改进共享特征,而是来自标准编码器从未学习到的特征;其字典插槽被范数检测器占据。我们将原因追溯到范数膨胀下的前向 TopK 选择:通过损失重加权均衡不同范数水平的梯度几乎无法缩小差距,证实评分几何本身(而非训练信号)才是杠杆。这种优势在各层和模型间可复现,但并非普遍存在;深层 LayerNorm 层和情感是例外,其中幅度携带任务相关信号。

**贡献**
- **架构。** 我们引入余弦评分稀疏自编码器,将内积编码器评分替换为可学习指数的余弦评分,该评分在纯余弦(\(a=0\))和内积(\(a=1\))之间插值。我们研究全局和每特征参数化,并确定使每种参数化稳定的设计选择(§3)。
- **结果。** 在匹配重建、KL 散度和每特征可解释性的条件下,余弦编码器在 Qwen3-8B 上将稀疏探测 top-1 提升了 \(+14.9\%\)。一个匹配特征分解表明,差距的大部分来自标准编码器从未学习到的特征,而非来自改进共享特征。该结果在各层间复现,并在 Gemma-2-2B 上成立(§4.1,§4.3)。
- **机制。** 标准编码器的未匹配特征 overwhelmingly 在高范数 token 上激活;它们编码的是幅度,而非内容。范数膨胀下的前向 TopK 选择是主要原因;通过损失重加权均衡不同范数水平的梯度几乎无法缩小差距,证实评分几何本身才是杠杆。优化器独立地证实了这一点:训练将 \(a\) 推向远离内积区域,没有任何特征选择超过半幅度的范数依赖(§4.3,§6)。对于从业者来说,这是一个即插即用的编码器更改,能在不牺牲重建质量的情况下产生更可解释的字典。更广泛地说,这表明评分几何是字典学习中被忽视的设计维度:如果内积对于归一化表示是错误的归纳偏差,那么现代 Transformer 上训练的标准 SAE 字典可能系统性低估内容特征。我们相信,余弦评分应成为归一化表示上字典学习的默认选择,并且我们识别的失败模式很可能影响任何训练在 RMSNorm 后位置上的内积 SAE。

## 2 背景

一个稀疏自编码器(SAE)接受激活值 \(x \in \mathbb{R}^d\),通过一个单层编码器-解码器对将其投影到稀疏码 \(z \in \mathbb{R}^{d_{\mathrm{sae}}}\),并将解码器行 \(\{W_{\mathrm{dec},i}\}\) 解读为特征字典:
\[
z = \sigma\left((x - b_{\mathrm{dec}})W_{\mathrm{enc}}^\top + b_{\mathrm{enc}}\right) \quad \hat{x} = z W_{\mathrm{dec}} + b_{\mathrm{dec}}.
\]
重建损失为:
\[
\mathcal{L} = \|x - \hat{x}\|^2.
\]
不同的 SAE 变体以不同方式使 \(\sigma\) 稀疏,包括 TopK (Gao et al., 2024)、BatchTopK (Bussmann et al., 2024)、JumpReLU (Rajamanoharan et al., 2024b)、门控激活 (Rajamanoharan et al., 2024a) 和 AbsTopK (Zhu et al., 2025)。SAE 倾向于假设线性表示假说:概念对应激活空间中的线性方向 (Park et al., 2024, 2025;Elhage et al., 2022)。最近的变体修改字典几何 (Korznikov et al., 2025;Bussmann et al., 2025) 或损失形状 (Nasiri-Sarvi 等, 2026),但保留编码器评分不变。特征的预激活值仍然是内积 \(\langle w_i, x \rangle = \|w_i\|\,\|x\|\,\cos(w_i, x)\),因此范数更大的 token 会在方向对齐不变的情况下提高评分。遵循标准实践 (Bricken et al., 2023;Gao et al., 2024;Karvonen et al., 2025),解码器行在训练期间被约束为单位范数:每次优化器步骤后重新归一化,并将解码器梯度中平行于每一行的分量投影掉,以考虑 Adam-归一化交互 (Gao et al., 2024)。因此,字典表示方向,任何每特征尺度都被吸收进编码器。编码器读取以解码器偏置为中心的输入(\(x \mapsto x - b_{\mathrm{dec}}\),如上式所示),将其零点与重建原点绑定 (Bricken et al., 2023)。

我们将 SAE 挂在残差流上:激活值 \(x\) 是流经每个 Transformer 块而不变的向量,每个子层向其中添加信息。大多数现代 Transformer 在进入每个子层的路径上放置一个 RMSNorm (Zhang and Sennrich, 2019):
\[
\mathrm{RMSNorm}(x) = \sqrt{d}\,\frac{x}{\|x\|} \odot g, \quad g \in \mathbb{R}^d.
\]
因此,每个子层读取的是 \(x/\|x\|\)(加上逐坐标的门控 \(g\)),而非 \(x\) 本身。SAE 提前一步挂在残差流上,仍然看到完整的 \(x\)。方向相同但范数不同的两个激活值,对模型来说看起来几乎相同,但对内积编码器来说,其评分则按其范数之比区分。残差流范数在实际中呈重尾分布,由异常维度 (Timkey and van Schijndel, 2021) 和离群特征 (Dettmers et al., 2022) 驱动,因此这种偏差并非假设。在随机 token 对之间直接交换激活方向(无 SAE 参与)会产生 \(219\times\) 更大的下游 KL 散度,相比在相同层交换它们的范数(附录 C.1)。模型的计算以方向为主导;SAE 的编码器也应如此。

我们全程使用 BatchTopK (Bussmann et al., 2024),即 SAEBench 默认 (Karvonen et al., 2025)。BatchTopK 施加一个单一的全批量激活预算,而不是强制每个 token 恰好 \(k\) 个特征,允许模型为复杂 token 分配更多特征,为简单 token 分配更少特征。给定一个批量 \(N\) 个 token 上的预激活值 \(u = \sigma(x W_{\mathrm{enc}}^\top + b_{\mathrm{enc}}) \in \mathbb{R}^{N \times d_{\mathrm{sae}}}\),\(z = \operatorname{BatchTopK}(u)\) 仅保留最大的 \(kN\) 个条目,将其余置零。这种灵活性也意味着高范数 token 可以占用不成比例多的插槽:其膨胀的预激活值在批量范围内的排名中占主导地位,无论方向对齐如何。我们的余弦评分仅修改编码器预激活值,而非稀疏机制;原则上它与任何选择器(TopK、JumpReLU、门控)兼容,但本文仅测试 BatchTopK(参见附录 A)。更广泛地说,现代架构正在增加归一化(QK-范数 (Henry et al., 2020;Dehghani et al., 2023)、nGPT (Loshchilov et al., 2024)),加强了方向感知型 SAE 编码器的理由。

**评估指标。** 我们全程遵循 SAEBench (Karvonen et al., 2025)。重建以方差分数(fraction of variance explained, FVE)报告。

相似文章

稀疏自编码器中概念学习与神经元解释的几何视角

arXiv cs.LG

本文提出了一个统一的几何框架,用于理解稀疏自编码器中的概念学习和神经元解释,将概念形式化为集合,并定义了检测、分离和近似。它提供了误差界、容量约束,并与形式概念分析建立了联系,同时在合成数据上进行了实验。