稀疏性与叠加对简单自编码器损失的影响
摘要
本文对神经网络中的叠加现象进行了数学分析,推导了具有幂激活函数的简单自编码器的L2重建损失的上下界,验证了Elhage等人的实证结果。
arXiv:2606.18538v1 公告类型:新
摘要:神经网络机制可解释性的主要困难之一是多义性(polysemanticity)的出现,这暗示每个神经元通常负责多个不同的任务,阻碍了对其功能的清晰解释。Elhage等人(2022)的开拓性论文认为,这是由于叠加现象引起的,即神经网络将不同的特征表示为低维空间中的非正交方向,这种策略允许在不牺牲保真度的情况下对数据进行更大的压缩,原因在于输入向量的特征稀疏性。Elhage等人(2022)在一个非常自然且简单的具有稀疏输入的自编码器中经验性地验证了这些假设。本工作的贡献在于分析叠加现象出现及其最优性的数学基础,同时严谨地证实了他们的一些发现。特别地,我们针对幂激活函数,给出了L2重建损失的上下界,这些界限在非常稀疏的情况下是紧的。文末还附有一份简短的有趣的开放问题列表。
查看缓存全文
缓存时间: 2026/06/18 05:44
# 稀疏性与叠加对简单自编码器损失的影响 来源:https://arxiv.org/abs/2606.18538 查看 PDF (https://arxiv.org/pdf/2606.18538) > **摘要:**神经网络机械可解释性面临的主要困难之一是多义性现象,即每个神经元通常负责多个不同任务,从而阻碍了对其功能的清晰解读。Elhage等人(2022)的开创性论文指出,这种现象源于叠加效应——神经网络将不同特征表示为低维空间中的非正交方向,这种策略能够在输入向量具有特征稀疏性的前提下,在不牺牲保真度的情况下实现更高的数据压缩。Elhage等人(2022)在一个相当自然且输入稀疏的简单自编码器中通过实验验证了这些假设。本文的贡献在于分析了叠加现象产生及其最优性的数学基础,同时对其部分发现进行了严格的佐证。具体而言,我们针对幂激活函数给出了L2重建损失的上界和下界,并在极稀疏情况下达到紧致性。文末还附有一份简短的有趣开放问题列表。 ## 提交历史 来自:Eric Weiner \[查看邮件 (https://arxiv.org/show-email/11943499/2606.18538)\] **\[v1\]** 2026年6月16日星期二 23:14:24 UTC (95 KB)
相似文章
理解边缘:稀疏自编码器追踪Transformer泛化的界限
本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。
稀疏自编码器中概念学习与神经元解释的几何视角
本文提出了一个统一的几何框架,用于理解稀疏自编码器中的概念学习和神经元解释,将概念形式化为集合,并定义了检测、分离和近似。它提供了误差界、容量约束,并与形式概念分析建立了联系,同时在合成数据上进行了实验。
解决AI中叠加问题以实现可解释性与患者神经元图像的跨模态对齐
本文引入稀疏自编码器来解决神经网络中的叠加问题,提高潜在空间的可解释性和几何保真度,并提出GW-map实现图像表示与单细胞RNA测序数据之间的跨模态对齐。
不稳定特征,可重现子空间:理解稀疏自编码器中的种子依赖性
本文研究稀疏自编码器中的种子依赖性,发现稳定特征携带大部分预测信号,而不稳定特征反映了可重现的低维子空间。
@TamazGadaev:第10天/n(面向AI研究人员的基础文本系列——并非特指论文,而是那些能让你掌握实际进行AI研究方法的作品)
Elhage等人的《叠加的玩具模型》解释了可解释性为何困难:模型通过叠加来用少于特征维度的方式表示更多特征,导致多语义神经元作为压缩手段出现。这篇论文催生了稀疏自编码器的研究计划。