neural-network-training

标签

Cards List
#neural-network-training

梯度下降神经网络训练的通用性

Hacker News Top · 2026-08-20 缓存

论文探讨了是否任何神经网络都可以被重新设计以通过梯度下降有效训练,并证明了一个通用性结果:对于任何网络,都存在一个扩展,可以通过梯度下降重现给定的权重和输出。

0 人收藏 0 人点赞
#neural-network-training

前向传播领域适应(无跨层反向传播)

arXiv cs.LG · 2026-08-18 缓存

仅前向传播的MLP训练(FPO)在无需反向传播的情况下适应大型语言模型,实现2.7–3.2倍的吞吐量提升,同时峰值内存减少40%,并保持基准性能。

0 人收藏 0 人点赞
#neural-network-training

Aurora: 一种杠杆感知的谱优化器

arXiv cs.LG · 2026-06-29 缓存

Aurora是一种杠杆感知的谱优化器,通过强制执行行均匀性同时保留Muon更新的极因子几何结构来解决MLP层中的神经元死亡问题,在modded-nanoGPT speedrun基准上实现了最先进的性能。

0 人收藏 0 人点赞
#neural-network-training

Zeta:基于坐标自适应预条件的矩阵优化双白化方法

arXiv cs.LG · 2026-06-15 缓存

Zeta 提出了一种双白化优化器,它首先应用坐标白化,再进行谱白化,以解决动量矩阵中的尺度异质性,从而降低正交化误差,并在大规模神经网络训练中改善收敛速度和泛化性能。

0 人收藏 0 人点赞
#neural-network-training

Muon$^p$: 分数谱幂的Muon优化器

arXiv cs.LG · 2026-06-15 缓存

本文介绍了Muon^p,一种新颖的优化器,采用分数谱幂更新在Muon和梯度下降之间进行插值,提供了理论证明并在十亿参数规模的微调任务上取得了实证收益。

0 人收藏 0 人点赞
#neural-network-training

Muon需要多少正交化?

arXiv cs.LG · 2026-06-02 缓存

本文研究了Muon优化器需要多少正交化,提出了一种五步三次牛顿-舒尔茨方案,该方案降低了计算成本,同时在GPT-2 Small和混合MoE/Mamba模型上实现了与更昂贵方法相似的训练质量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈