不稳定特征,可重现子空间:理解稀疏自编码器中的种子依赖性
摘要
本文研究稀疏自编码器中的种子依赖性,发现稳定特征携带大部分预测信号,而不稳定特征反映了可重现的低维子空间。
查看缓存全文
缓存时间: 2026/06/16 15:32
论文页面 - 不稳定特征,可重现子空间:理解稀疏自编码器中的种子依赖性
来源:https://huggingface.co/papers/2606.12138
摘要
稀疏自编码器表现出特征稳定性模式,其中稳定特征承载大部分预测信号,而不稳定特征尽管个体不可重现,却反映了可重现的低维结构。
稀疏自编码器(https://huggingface.co/papers?q=Sparse%20autoencoders)(SAEs) 被广泛用于解释神经网络表示,但其实用性取决于学习到的特征是否能在不同训练轮次中重现。我们通过特征稳定性(https://huggingface.co/papers?q=feature%20stability)研究这一问题:对于每个 SAE 特征,我们估计在独立训练的 SAE 中出现类似特征的概率。这提供了一种可扩展的逐特征信号,将稳定特征与不稳定特征区分开来。在跨种子、模型、层、字典大小和 SAE 变体的大规模研究中,我们发现了显著的功能不对称性:稳定特征承载了大部分重建和预测相关信号(https://huggingface.co/papers?q=prediction-relevant%20signal),而不稳定特征的边际影响微弱,并且在激活统计(https://huggingface.co/papers?q=activation%20statistics)和自动解释(https://huggingface.co/papers?q=automatic%20explanations)中主要由低频表面形式触发主导。从几何角度看,不稳定特征个体上不可重现,但集中在可重现的低秩子空间中,这表明种子依赖性往往反映了共享激活空间区域内的基歧义(https://huggingface.co/papers?q=basis%20ambiguity),而非纯粹噪声。一个受控的合成模型明确揭示了这一机制:低秩的真实特征可以在子空间层面被恢复,但在不同种子间作为个体 SAE 潜在变量仍然不可辨识。最后,通过汇集唯一的跨种子特征(https://huggingface.co/papers?q=cross-seed%20features),我们构建了更稳定的 SAE,同时在此设置中保持了解释方差(https://huggingface.co/papers?q=explained%20variance)。这些结果共同表明,不稳定特征并非仅仅是失败或含噪声的潜在变量:它们的个体功能影响微弱,但却反映了标准 SAE 在不同种子间以不同方式解析的可重现低维结构。
查看 arXiv 页面(https://arxiv.org/abs/2606.12138)查看 PDF(https://arxiv.org/pdf/2606.12138)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.12138)
在您的代理中获取此论文:
hf papers read 2606\.12138
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2606.12138 即可从此页面链接。
引用此论文的数据集0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2606.12138 即可从此页面链接。
引用此论文的 Space0
没有链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2606.12138 即可从此页面链接。
包含此论文的集合0
没有包含此论文的集合
将此论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
稀疏自编码器中特征饥饿的几何不稳定性
本文将稀疏自编码器中的特征饥饿识别为一种几何不稳定性,并提出自适应弹性网络 SAE(AEN-SAE)来在不依赖启发式方法的情况下缓解该问题。
使用Procrustes条件的联合端到端Top-K稀疏自编码器的跨种子可解释性
本文提出了一种Procrustes条件的联合端到端Top-K稀疏自编码器,用于从独立训练的BERT模型中提取通用特征,在跨种子特征对齐方面优于事后对齐方法。
稀疏自编码器表示中的特征竞争:大语言模型中不确定性驱动的特征竞争机制研究
本研究论文在大语言模型中引入了稀疏自编码器表示中的“特征竞争”概念,将其作为不确定性的机制性特征。利用 Gemma-2-2B 模型,研究表明,负相关的特征对将不确定性定位到特定层级,并对模型输出产生因果影响。
从几何恢复到因果验证:稀疏自编码器特征的可重现审计,从叠加几何到因果惰性
本文使用因果干预对稀疏自编码器特征进行审计,发现在退化的SAE中最多77%的相关性恢复特征以及良好训练的SAE中9%的特征是因果惰性的。作者引入了sae-causal-audit工具用于可重现评估。
特征组合的结构不稳定性
本文提出了一个几何框架来分析稀疏自编码器中特征组合的不稳定性,揭示了非线性导致棘轮效应,从而在超过临界密度时引发组合坍塌。