Bug or Feature^2:权重漂移、激活稀疏性与尖峰
摘要
本文正式证明了使用非对称激活函数(如ReLU、GELU或SiLU)训练神经网络会导致权重向负方向漂移,进而使激活稀疏性高达90%。同时,研究表明平方激活函数(如ReLU²)能提升性能,但会导致激活尖峰,这一问题可通过裁剪解决,其中GELU²达到了最低验证损失。
查看缓存全文
缓存时间: 2026/05/20 22:40
论文页面 - Bug or Feature^2:权重漂移、激活稀疏性与尖峰
来源:https://huggingface.co/papers/2605.17659
每次你用 ReLU、GELU 或 SiLU 训练网络时,权重都会悄悄地向负值漂移。这不是数据的问题,即便是随机输入也会发生。这是梯度下降与非对称激活函数的数学特性所固有的。
我们从数学上证明了这一点(MSE 和交叉熵),并在 MLP、ResNet、ViT、GPT 以及一个语音模型上展示了这种现象。
这种漂移会导致什么? 负权重将预激活值推入负区域,而使用 ReLU 时,多达 90% 的激活最终变为零——正是被最初导致漂移的同一个函数清零了!这到底是 bug 还是 feature?取决于如何使用。
最有趣的发现: ReLU2 提升了 GPT-nano 的性能,但病态地将激活尖峰放大了 25 倍。解决方法很简单:进行裁剪。裁剪后的 ReLU2 和 GELU2 都优于其非平方版本,其中 GELU2 在 GPT-nano 上取得了整体最佳的验证损失。
💻 代码:github.com/On-Point-RND/BugOrFeature
相似文章
通过平滑激活缓解深度神经网络一致收敛中的维数灾难
本文建立了一个理论框架,表明深度神经网络中的平滑激活可以缓解一致收敛中的维数灾难,提供非渐近保证,并在最坏情况可靠性上优于ReLU网络。
@linghaokong76: 网络能否在不增加非零权重的情况下表现更好?我们的ICML 2026论文指出:将相同的活跃权重分散到更多神经元上…
一篇新的ICML 2026论文表明,将相同的活跃权重分散到更多神经元上可以减少冲突并提高精度,这表明网络可以在不增加非零权重的情况下表现更好。
任意权重双层神经网络的鲁棒性定律
本文证明了一个关于无界权重双层神经网络的猜想鲁棒性定律,表明对于连续分段线性激活函数(如ReLU),拟合含噪数据的网络其Lipschitz常数至少为√(n/m)量级(最多差一个对数因子)。
从权重到特征:SAE引导的激活正则化用于LLM持续学习
本文提出了一种用于大语言模型的持续学习方法,该方法使用预训练的稀疏自编码器(SAEs)在激活空间而非权重空间中进行正则化,从而在无需存储先前数据的同时避免灾难性遗忘,并实现了更好的内存效率和更强的基准性能。
Hidden Gauge Controls Feature Specialization in ReLU Networks
A theoretical study shows that in overparameterized ReLU networks, a positive-homogeneous scaling gauge hidden in the initial parameters can deterministically control which duplicate neuron learns a teacher feature, affecting specialization time and pruning trajectories.