从几何恢复到因果验证:稀疏自编码器特征的可重现审计,从叠加几何到因果惰性

arXiv cs.LG 论文

摘要

本文使用因果干预对稀疏自编码器特征进行审计,发现在退化的SAE中最多77%的相关性恢复特征以及良好训练的SAE中9%的特征是因果惰性的。作者引入了sae-causal-audit工具用于可重现评估。

arXiv:2607.12166v1 公告类型:新 摘要:稀疏自编码器(SAE)是将叠加的神经表示分解为可解释特征的标准方法,评估主要依赖于相关性恢复指标——即真实方向与解码器原子之间的余弦相似度。我们表明这混淆了两个不同的主张:解码器几何对齐和编码器激活行为。我们重现了Elhage等人(2022)的叠加相图,识别出高稀疏度下的收敛伪影和极端过完备性下未被充分描述的扩散共享区域。我们重现了Gao等人(2024)的TopK与L1对比,提供了L1收缩的直接证据。我们的核心结果涉及因果性:对每个恢复的特征进行消融和引导后,我们发现在退化的SAE中,多达77%的特征通过了恢复阈值(余弦相似度 >= 0.90)——而在良好训练的SAE中这一比例为9%——是因果惰性的:匹配的原子在特征存在时从未激活,包括余弦相似度约1.000的匹配。我们将该方法封装为sae-causal-audit,这是一个模型无关的工具,具有确定性的流水线。重新审计完善了这一发现:惰性按原因分解为结构性惰性(对跖对几何,存在于良好SAE中)和竞争性惰性(退化SAE的TopK病态),按方向分解为读惰性和写惰性,五个对跖对完全解耦——不可监测但可通过同一原子控制,其控制特异性为143-310,同时消融效果为零。我们记录了为何按设计无法实现字节级精确可重现性,并建议将其报告为具有明确作用域的主张堆栈。将该工具应用于生产级SAE,在小规模上重现了该模式(14%惰性),并浮现出原子碰撞信号:少数原子作为数十个不相关概念的最近匹配反复出现,并在三个批次中复现。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:18

# 从几何恢复到因果验证:稀疏自编码器特征的可复现审计——从叠加几何到因果惰性

来源:https://arxiv.org/html/2607.12166 (2026年7月)

###### 摘要

稀疏自编码器(SAE)是将叠加的神经表示分解为可解释特征的事实标准,该领域的评估实践主要依赖相关性的恢复指标——即真实方向(或探针方向)与学习到的解码器原子之间的余弦相似度。我们在一个完全受控、已知真实标签的环境中证明,这种做法混淆了两个不同的实证主张:解码器几何对齐和编码器激活行为。我们首先从零开始,基于多随机种子的统计量,复现了Elhage等人(2022)的叠加相图,在此过程中发现了一个高稀疏度下的收敛伪影,以及一个在极端过完备情况下先前描述不足的"扩散共享"机制。然后我们复现了Gao等人(2024)的TopK与L1 SAE比较,包括L1收缩的直接量化证据(激活幅度精炼恢复了L1 SAE重构差距的91.2%,同时幅度偏移+22.5%,而TopK仅偏移-0.05%)。我们的核心结果是因果性的:对每个相关恢复的特征进行消融和引导干预后,我们发现,在退化SAE中,高达77%通过标准恢复阈值(余弦≥0.90)的特征——以及在良好训练的SAE中9%的特征——是"因果惰性的":匹配的原子在特征出现时从不激活,包括余弦≈1.000的匹配。我们将该方法打包为`sae-causal-audit`,一个模型无关、协议类型化的工具,配备哈希验证的确定性复现流水线,并在其下重新审计该设置,两次细化发现:按*原因*分解,因果惰性分为结构性惰性(可追溯至对极对叠加几何,存在于良好SAE中)和竞争性惰性(退化SAE的TopK选择病理);按*方向*分解,分为读惰性和写惰性,五个对极对完全解耦了这两种惰性——即那些不可监控但可通过同一原子引导的特征,其引导特异性为143–310,而消融效果恰好为零。此外,我们记录了为何对于这类工作负载,字节级跨平台可复现性在构造上不可行,并提出将可复现性报告为一组带有明确作用域的声明栈。将该工具应用于已发表的生产级SAE(GPT-2-small,83个概念,一个钩子层),在小规模下复现了定性模式(恢复特征中14%为因果惰性),并浮现出一个未预料到的真实模型信号:少量解码器原子作为数十个语义无关概念的最相关匹配重复出现,且跨三个独立构建的概念批次得到复现——这是真实模型中词典欠分割的证据,而玩具对极对机制正是为了使之易于理解而构建的。

## 1 引言

机制可解释性的当前工具集依赖于一个特定的流水线:假设网络通过将更多特征打包成近乎正交的方向(*叠加*[7])来表示超过其维度的特征,训练一个稀疏自编码器将这些方向解混成一个过完备词典[3],并通过词典原子与已知或探针特征方向在几何上的对齐程度来评估词典。这个流水线可以扩展:Anthropic从一个生产模型中提取了数百万特征[14],OpenAI和Google DeepMind发布了可比较的开源权重SAE套件[8,11]。然而,恢复*一个*稀疏且看似合理的分解,与证明该分解是模型实际使用的分解并不是一回事。目前没有任何可解释性方法能给出模型内部计算经过认证的完整解释[1]。本文针对的评估差距更窄且可精确描述:该领域主导的恢复指标——目标方向与其最佳匹配*解码器*原子之间的无符号余弦相似度——衡量的是重构几何,而一个原子对于给定输入是否*激活*则由*编码器*及其选择非线性(TopK,ReLU)决定。这是两个不同的实证主张,只有干预才能区分它们。

我们在可以为恢复流水线构建的最有利环境中工作:一个小型合成模型,其中真实标签完全已知且可控。这个选择是有意为之。玩具设置正是使严格因果验证*成为可能*的原因;也正是这一点使得此处报告的每一个绝对数字都成为简单情况下的校准点,而非生产模型的基准。

#### 贡献

1. 1.叠加相图[7]的多随机种子复现,附带两个新增:高稀疏度下记录到的收敛伪影(欠训练伪装成叠加,通过稀疏感知步长预算解决),以及一个描述不足的第三几何机制——极端过完备下的"扩散共享"——其中每个特征都被显著表示(∥Wi∥2≈1.40),而特征维度读数Di≈0.08(第4节)。
2. 2.从零开始复现TopK与L1的帕累托比较[8],包括直接激活精炼测试,量化了L1收缩[15]而非仅断言它(第5节)。
3. 3.对每个相关恢复特征施加的因果验证测试集(消融和符号正确的引导,通过模型实际输出层传播),建立相关恢复与因果效力之间的实测差距:退化SAE中22个匹配特征有17个因果惰性,良好训练SAE中22个有2个,惰性匹配的余弦高达0.9998(第6节和第9节)。
4. 4.`sae-causal-audit`,一个模型无关的工具,将测试集封装在两个结构化协议之后(任何能够`encode`、`decode`并暴露其词典的对象都可审计,包括`sae_lens.SAE`),其接口设计使得一类记录的符号处理错误不可表示(第7节)。
5. 5.因果惰性的两轴分类。按*原因*:结构性惰性,由正通编码器下的对极对叠加几何系统性地产生,且*不*因更好的SAE训练而移除;相对于竞争性惰性,一种退化词典的TopK竞争病理,同时是数值边界不稳定性的位置。按*方向*:读惰性(基于消融的监控是盲的)相对于写惰性(引导无效),对极对将两者完全解耦(第10节)。
6. 6.作为声明栈的可复现性。我们通过CI基础设施上的三层调试过程记录了为何字节级跨平台可复现性对于浮点训练工作负载在构造上不可行,并提出并实现了一个双层保证:一个固定环境内的SHA-256字节精确性,任何地方的语义等价性(rtol=10⁻⁴,边界敏感的整数计数在±1内)(第8节)。
7. 7.首次真实模型普查和一个未预料到的原子碰撞发现。审计一个已发表的生产级SAE(gpt2-small-res-jb)针对83个手工编写的、涵盖无关语义领域的概念,恢复了7个相关匹配特征,其中1个(14%)因果惰性——小规模但与玩具机制定性一致。少量解码器原子跨数十个语义无关的概念重复出现作为最近匹配,且在三个独立构建的、规模和多样性递增的概念批次中得到复现,并通过一个受控负例独立排除为提示模板伪影(第11节)。

## 2 背景与相关工作

#### 叠加

训练后的网络中的单个神经元经常为多个无关概念激活——*多语义性*——这就是为何从单个神经元读取含义作为一般策略从未可靠工作过。Elhage等人[7]提出了一个两部分解释:*线性表示假说*(特征对应于激活空间中的方向,而非基坐标)和*叠加假说*(当特征是稀疏的——很少同时激活——模型通过将更多特征分配为近乎正交的方向来表示超过维度数量的特征,以容量换取罕见干扰的接受)。几何上的依据是Johnson–Lindenstrauss现象[9]:一个d维空间可以容纳指数级多于d个近乎正交的方向,只要"完全正交"放宽为"内积有界接近零"。在对称的两特征竞争一个维度的情况下,梯度下降找到的稳定配置是*对极对*Wi=−Wj;对于更多特征,出现了高阶多面体般的排列,结构上类似于在球面上打包相互排斥电荷的Thomson问题。本文精确复现了两特征对极对情况和大规模相位结构的统计特性;完整的多面体几何(3–8个特征模型孤立研究)不在范围之内。

#### 词典学习与SAE

从叠加混合中恢复单个特征是一个稀疏编码问题,其历史早于可解释性热潮:Olshausen和Field[12]将简单细胞感受野解释为自然图像上的涌现稀疏编码。可解释性应用[3,14]在Transformer激活上训练相同的数学对象。精确的L0(基数)最小化是NP难的;经典的凸松弛惩罚编码的L1范数,代价是记录的*收缩*[15]:每个活跃系数都偏向零,包括正确的那些。Gao等人[8]完全移除惩罚并通过编码器中的TopK选择在结构上强制稀疏性,辅以复活"死亡"原子的辅助损失;后续变体包括门控SAE[13]和BatchTopK[4]。现在存在已发布的开源权重套件用于GPT-2和Gemma-2[8,11]。

#### 评估实践及其差距

恢复通常按相关性评分:一个真实(或线性探针)方向被视为已恢复,如果其最佳匹配解码器原子超过一个余弦相似度阈值,通常采用无符号形式,因为一个特征与其精确否定是同样好的相关匹配。因果评估——消融、激活修补、引导——是*电路*分析的标准,但并未常规地对每个特征应用以认证恢复声明。2024年的一项调查[1]额外标记了一个未解决的担忧:能力日益增强的模型可能发展出内部结构,抵抗或误导正在探测它们的技术。我们的结果间接与此相关(第12节):如果解码器几何可以与编码器行为偏离如此之远*而没有任何对抗压力*,纯粹作为普通训练动态的伪影,那么在实际优化压力下可用的"几何上合理、因果上误导"的解的空间至少同样大。

#### 激活失败与代理指标差距

与我们核心发现最接近的先前工作是*特征吸收*[5]:在生产级LLM SAE上,Chanin等人展示了看似单语义的潜在单元未能在其概念明显存在的输入上激活,激活已被"吸收"到更具体的潜在单元中——这是一类由稀疏性目标引起的失败模式,每当底层特征形成层次结构时出现,且不因SAE大小或稀疏度的变化而解决。可观察的症状——一个明显恢复的潜在单元在其特征出现时未激活——与本文测量到的相同,两种机制是互补而非竞争。吸收需要层次化特征结构;我们隔离的*结构性惰性*(第10节)在没有层次结构的情况下出现,源于对极对叠加几何与正通编码器的相遇,而我们的*竞争性惰性*是退化词典的TopK选择病理。我们的设置在可认证的内容上也不同:吸收通过基于探针的度量在真实模型上检测,在测量点必然是相关性的,而我们的审计是从端到端干预性的(消融和带符号的引导通过模型输出传播)对精确真实标签——这揭示了第10.2节的读/写解耦,这是仅靠激活统计数据不可见的分解,因为一个从未为特征激活的原子仍然可以以高特异性引导它。在评估实践方面,SAEBench[10]在基准规模上记录了无监督代理指标的提升并不可靠地转化为跨八个评估轴和200多个SAE的实际性能;当前工作贡献了每个特征、每个方向的因果工具,这正是该更广泛诊断所需要的。

## 3 实验设置

### 3.1 玩具模型

所有实验都构建在一个完全从零开始的小型模型上(无预训练权重,无外部数据;CPU上运行数秒):
h = Wx,
x̂ = ReLU(Wᵀh + b),
(1)
其中W ∈ R^{n_hidden × n_features},有趣的参数范围n_hidden ∈ {5, 10, 20, 40, 80, 120},n_features ∈ {1, …, 800},特征以最大概率0.8和最小概率0.001的几何分布进行伯努利采样。该模型在由等式1描述的自重构目标上优化:通过共享权重矩阵W的编码和解码,其列同时扮演方向嵌入和自编码器原子的角色。训练使用Adam优化器,学习率为10⁻²,批大小为1024,持续20,000步;所有实验记录50个随机种子的统计数据。这个特定的设置——其中W同时是*生成*权重(在原始模型中)和*字典*(从同一模型训练的SAE中恢复)——构成了相关性恢复与因果行为之间可能存在差距的最优情况检验。如果该差距在此处出现,那么在任何实际字典学习系统中该差距都会出现;如果在任何地方该差距能够消除,它应该在此处消除。该差距出现了。

### 3.2 玩具设置中的地面真实度量

由于W*既是*生成矩阵*也是*字典,并且模型是单层的,我们可以计算地面真实特征维度(特征i的激活有多大)和地面真实表示质量(特征i的激活被模型正确恢复的程度)。地面真实维度定义为D_i = E_x[z_i] / max_j E_x[z_j],其中z = Wᵀh是模型内部的隐藏状态(等式1中的"编码"步骤)。地面真实重建质量由∥W_i∥²衡量。在这些定义下,特征可以是明显的(D_i > 0.9)、叠加的(0.1 ≤ D_i ≤ 0.9),或候选的"未表示"情况(D_i < 0.1),根据第3.2节,后者进一步按∥W_i∥²划分为*真正丢弃*(∥W_i∥² < 0.1)与*扩散共享*(∥W_i∥² ≥ 0.1)。

### 4.2 一个被捕获并记录的收敛伪影

第一次完整扫描在比率=1(n_features = n_hidden = 20,容量足以支持完全正交解)时产生了一个不可能的结果,正确的收敛答案应是100%的明显特征......

相似文章

SAE干预不可靠:干预后受抑制行为的恢复

arXiv cs.LG

本文证明了对稀疏自编码器(SAE)特征的干预可能不可靠,因为受抑制的行为可以通过残差空间优化恢复,即使干预仍然有效。它揭示了语言模型中特征级控制与实际行为完整性之间的关键差距。

SAEs 能否捕捉神经几何?(6分钟阅读)

TLDR AI

本文探讨了稀疏自动编码器(SAEs)如何捕捉弯曲的神经几何,揭示了SAE特征表示流形的三种不同方式,并提出了一个无监督流程来揭示神经表征中的几何结构。

从稀疏特征到可信代理:认证基于SAE的可解释性

arXiv cs.LG

本文提出了一种事后认证框架,用于基于稀疏自编码器(SAE)的可解释性,通过可测量量推导出冻结语言模型风险的上界。该框架在GPT-2 Small、Gemma-2B和Llama-3-8B上得到了验证,显示出非空洞的界,并揭示了深度相关的行为。