重新参数化Shampoo和SOAP以支持子空间基更新和BFloat16存储
摘要
本文提出了一种对基于Shampoo的优化方法(如KL-Shampoo和SOAP)中预条件器的重新参数化,以支持BFloat16存储,并通过在子空间中仅通过QR分解更新部分基来减少计算开销,从而使这些方法在内存和时间上更高效。
arXiv:2605.26327v1 公告类型:新
摘要:基于Shampoo的方法(如KL-Shampoo和SOAP)在训练神经网络中表现出色,且依赖于QR分解。由于现有的QR实现需要单精度(FP32)算术且计算成本高昂,当预条件矩阵较大时,这些方法会变得耗时且占用大量内存。此外,使用BFloat16(BFP16)存储来减少内存占用会降低基于Shampoo的方法的性能。我们提出了一种预条件器的重新参数化,该参数化支持BFP16存储,并通过将更新的基向量与未更改的基向量结合形成完整的基。通过在子空间中仅通过QR分解更新部分基,我们的方法减少了计算开销,同时缓解了BFP16存储带来的性能下降。我们的方法广泛适用于使用QR分解的基于Shampoo的方法,包括KL-Shampoo、SOAP和KL-SOAP。特别地,它提升了SOAP和KL-SOAP在BFP16存储下的性能,使KL-SOAP能够匹配或超越KL-Shampoo。总体而言,我们的方法使基于Shampoo的方法在内存和时间上更高效。
查看缓存全文
缓存时间: 2026/05/27 09:08
# 重参数化Shampoo与SOAP以实现子空间基更新与BFloat16存储 来源:https://arxiv.org/abs/2605.26327 查看PDF(https://arxiv.org/pdf/2605.26327) > **摘要:**基于Shampoo的方法(如KL-Shampoo和SOAP)在训练神经网络中表现出色,且依赖于QR分解。由于现有的QR实现需要单精度(FP32)算术且计算成本依然高昂,当预处理矩阵较大时,这些方法在时间和内存上变得非常密集。此外,使用BFloat16(BFP16)存储来减少内存占用会降低基于Shampoo的方法的性能。我们提出了一种预处理器的重参数化方法,该方法支持BFP16存储,并通过将更新后的基向量与未改动的基向量相结合来形成完整的基。通过子空间中的QR分解仅更新部分基,我们的方法减少了计算开销,同时缓解了BFP16存储带来的性能下降。我们的方法广泛适用于使用QR分解的基于Shampoo的方法,包括KL-Shampoo、SOAP和KL-SOAP。特别是,它提升了SOAP和KL-SOAP在BFP16存储下的性能,使KL-SOAP能够达到或超越KL-Shampoo。总体而言,我们的方法使基于Shampoo的方法在内存和时间上更加高效。 ## 提交历史 来自:Wu Lin [查看邮件(https://arxiv.org/show-email/8842e08e/2605.26327)] **[v1]** 2026年5月25日星期一 21:03:03 UTC(545 KB)
相似文章
SOAP、Muon 及更多:推动LLM预训练规模扩展
本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。
@burny_tech: 关于优化器魔法的更新
一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。
重新思考LLM FP4预训练中的收缩偏差:几何起源、系统性影响与UFP4方案
本文识别了LLM预训练中非均匀FP4量化格式的一个根本限制(收缩偏差),并提出了UFP4,一种优于现有基于E2M1方法的统一4位训练方案。
稀疏设计(5分钟阅读)
Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。
用于探索、净化和模型合并的谱重连方法
本文提出SAR,一种无需训练的方法,将强化学习更新投影到谱空间中的紧凑推理核心上,从而实现净化、改进探索和更强的模型合并。