@linghaokong76: 网络能否在不增加非零权重的情况下表现更好?我们的ICML 2026论文指出:将相同的活跃权重分散到更多神经元上…
摘要
一篇新的ICML 2026论文表明,将相同的活跃权重分散到更多神经元上可以减少冲突并提高精度,这表明网络可以在不增加非零权重的情况下表现更好。
查看缓存全文
缓存时间: 2026/07/07 01:22
网络能否在不增加非零权重的情况下表现更好?
我们的ICML 2026论文给出了肯定的回答:将相同的活跃权重分散到更多神经元上,能够减少冲突并提升准确率。
今天在ICML下午2点展示!
与 @inimai_s @yonashav @micahadler @DAlistarh 和 Nir Shavit 合作 https://t.co/hUxBOoIIrS
相似文章
Bug or Feature^2:权重漂移、激活稀疏性与尖峰
本文正式证明了使用非对称激活函数(如ReLU、GELU或SiLU)训练神经网络会导致权重向负方向漂移,进而使激活稀疏性高达90%。同时,研究表明平方激活函数(如ReLU²)能提升性能,但会导致激活尖峰,这一问题可通过裁剪解决,其中GELU²达到了最低验证损失。
通过稀疏电路理解神经网络
OpenAI 研究人员提出了一种训练稀疏神经网络的方法,通过强制大部分权重为零使其更易于解释,从而发现能够解释模型行为的小型解耦电路,同时保持性能。这项工作旨在推进机制可解释性,作为对稠密网络事后分析的补充,并支持 AI 安全目标。
权重归一化:加速深度神经网络训练的简单重参数化方法
OpenAI 提出了权重归一化,一种重参数化技术,通过将权重向量的长度与方向解耦,改进神经网络训练的收敛性和计算效率,且不引入小批次依赖关系,适用于循环神经网络和对噪声敏感的应用场景。
@rohanpaul_ai: @NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识…
来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。
通过 L₀ 正则化学习稀疏神经网络
OpenAI 提出了一种实用的神经网络 L₀ 正则化方法,在训练过程中促使权重精确变为零,实现网络剪枝以提高速度和泛化性能。该方法使用随机门控机制,引入硬具体分布(hard concrete distribution)使得不可微的 L₀ 范数优化能够通过梯度下降法求解。