优化器状态应驻留在何处?面向内存高效的混合专家训练的分层状态分配
摘要
SkewAdam是一种针对混合专家模型的新型优化器,它分层分配优化器状态至骨干网络、专家和路由器,将内存占用降至AdamW的2.6%,同时在受控对比中实现了更优的验证困惑度。
查看缓存全文
缓存时间: 2026/07/22 10:42
论文页面 - 优化器状态该驻留何处?面向内存高效的混合专家模型训练的分层状态分配
来源:https://huggingface.co/papers/2607.19058
摘要
优化器状态是混合专家模型(MoE)训练中内存预算最大的单项开支:对于一个67.8亿参数的MoE语言模型,AdamW需要占用50.6 GB的存储空间来保存一阶和二阶矩,以更新12.6 GB的bfloat16权重。我们研究了SkewAdam优化器,它基于以下观察构建:MoE的三个参数群体——密集主干网络、专家网络和路由网络——在规模和梯度统计特性上差异足够大,不应共享相同的状态。SkewAdam为主干网络(占参数量的5%)保留float32动量加上因式分解的二阶矩,为专家网络(占95%)仅保留因式分解的二阶矩,而为路由网络(<0.01%)保留精确的二阶矩。由此产生的状态占用1.29 GB,仅为AdamW的2.6%,峰值训练内存从81.4 GB降至31.3 GB,落入了40 GB加速器的预算范围内。在从相同初始条件出发、基于8200万tokens的受控对比实验中,SkewAdam的验证困惑度达到108.4,领先于AdamW(126.8)、Muon(120.2)和Lion(393.7),并将路由负载均衡度稳定在其均匀下限的1%以内。这种分配策略并非取得该困惑度的关键:对分层方案进行消融实验,在状态量扩大二十倍时仍能达到相同效果;而同样采用因式分解估计量但舍弃动量的Adafactor,则落后40点。分层方案在没有牺牲准确性的前提下节省了内存;真正的准确性来源于保留动量,而这在统一优化器中同样适用。调整基线学习率可以缩小差距,但无法完全弥合:经过最佳调参的AdamW达到118.5,调参后的Adafactor达到139.7。这些结果表明,优化器状态存放在何处,与状态总量的多少至少同等重要。
查看arXiv页面 (https://arxiv.org/abs/2607.19058)查看PDF (https://arxiv.org/pdf/2607.19058)GitHub1 (https://github.com/nuemaan/skewadam)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19058)
在您的Agent中获取本文:
hf papers read 2607.19058
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
尚无模型关联本文
请在模型的README.md中引用 arxiv.org/abs/2607.19058,以便在此页面建立链接。
引用本文的数据集 0
尚无数据集关联本文
请在数据集的README.md中引用 arxiv.org/abs/2607.19058,以便在此页面建立链接。
引用本文的Space 0
尚无Space关联本文
请在Space的README.md中引用 arxiv.org/abs/2607.19058,以便在此页面建立链接。
包含本文的收藏集 0
尚无收藏集包含本文
将本文添加到一个收藏集 (https://huggingface.co/new-collection) 以便在此页面建立链接。
相似文章
SkewAdam:一种分层优化器,将MoE状态内存减少97%(可在40GB GPU上容纳6.7B MoE模型)[R]
SkewAdam是一种分层优化器,可将MoE状态内存使用量减少97%,从而使得6.7B MoE模型能够适配单个40GB GPU。
MESH:用于混合专家训练的内存高效Sinkhorn优化
本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。
平滑长上下文混合专家训练中的所有内存峰值
本文介绍了管理长上下文长度下训练大型混合专家模型内存峰值的技术,包括Pipelined LLEP、Ring-DTP、SCO和OffloadStreamAdamW,这些技术实现了固定的GPU工作集,并将吞吐量提高了多达10.4倍。
Gefen:优化的随机优化器
Gefen是一种内存高效的优化器,通过自动共享二阶矩估计并使用学习到的码本量化一阶矩,将AdamW的内存占用减少约8倍,同时保持与AdamW相当的性能。
@_avichawla: https://x.com/_avichawla/status/2100876555409039605
这篇文章解释了Mixture-of-Experts (MoE) 推理的工程方面,详细介绍了令牌路由、专家批处理、GPU分配和性能权衡,以实现高效的服务。