@linghaokong76: 网络能否在不增加非零权重的情况下表现更好?我们的ICML 2026论文指出:将相同的活跃权重分散到更多神经元上…

X AI KOLs Timeline 论文

摘要

一篇新的ICML 2026论文表明,将相同的活跃权重分散到更多神经元上可以减少冲突并提高精度,这表明网络可以在不增加非零权重的情况下表现更好。

网络能否在不增加非零权重的情况下表现更好? 我们的ICML 2026论文指出:是的,将相同的活跃权重分散到更多神经元上可以减少冲突并提高精度。 今天下午2点在ICML上展示! 与 @inimai_s @yonashav @micahadler @DAlistarh & Nir Shavit https://t.co/hUxBOoIIrS
查看原文
查看缓存全文

缓存时间: 2026/07/07 01:22

网络能否在不增加非零权重的情况下表现更好?

我们的ICML 2026论文给出了肯定的回答:将相同的活跃权重分散到更多神经元上,能够减少冲突并提升准确率。

今天在ICML下午2点展示!

与 @inimai_s @yonashav @micahadler @DAlistarh 和 Nir Shavit 合作 https://t.co/hUxBOoIIrS

相似文章

Bug or Feature^2:权重漂移、激活稀疏性与尖峰

Hugging Face Daily Papers

本文正式证明了使用非对称激活函数(如ReLU、GELU或SiLU)训练神经网络会导致权重向负方向漂移,进而使激活稀疏性高达90%。同时,研究表明平方激活函数(如ReLU²)能提升性能,但会导致激活尖峰,这一问题可通过裁剪解决,其中GELU²达到了最低验证损失。

通过稀疏电路理解神经网络

OpenAI Blog

OpenAI 研究人员提出了一种训练稀疏神经网络的方法,通过强制大部分权重为零使其更易于解释,从而发现能够解释模型行为的小型解耦电路,同时保持性能。这项工作旨在推进机制可解释性,作为对稠密网络事后分析的补充,并支持 AI 安全目标。

通过 L₀ 正则化学习稀疏神经网络

OpenAI Blog

OpenAI 提出了一种实用的神经网络 L₀ 正则化方法,在训练过程中促使权重精确变为零,实现网络剪枝以提高速度和泛化性能。该方法使用随机门控机制,引入硬具体分布(hard concrete distribution)使得不可微的 L₀ 范数优化能够通过梯度下降法求解。