逐步扩展:大规模 Mixture-of-Experts 的计算高效超参数迁移
摘要
本文提出了一种计算高效的两步超参数迁移框架,用于预测大型 Mixture-of-Experts 模型的最优学习率,从而无需昂贵的超参数搜索即可实现高效预训练。
查看缓存全文
缓存时间: 2026/08/24 08:28
论文页面 - 循序渐进地扩展:面向大规模混合专家模型的计算高效超参数迁移
来源:https://huggingface.co/papers/2608.20061
摘要
一种两步超参数迁移框架,通过在不同宽度和 token 预算间进行扩展,预测大规模混合专家模型的最优学习率,从而实现无需昂贵搜索的高效预训练。
混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)(MoE)架构能在不成比例增加计算成本的情况下显著扩大模型容量。然而,在模型大小和 token 预算都达到极端规模时,通过搜索来优化其超参数——尤其是学习率——在计算上仍然代价高昂。在本文中,我们提出了一种计算高效的两步超参数迁移(https://huggingface.co/papers?q=hyperparameter%20transfer)框架。该框架通过在不同扩展的模型宽度间进行迁移,随后向万亿 token 规模外推,来估计训练大型 MoE 模型的最优学习率。首先,我们为采用多头潜在注意力(https://huggingface.co/papers?q=Multi-head%20Latent%Attention)(MLA)和 Muon 优化器(https://huggingface.co/papers?q=Muon%20optimizer)的 MoE 架构制定了最大更新参数化(https://huggingface.co/papers?q=Maximal%20Update%20Parameterization)(μP)适配方案,并证明最优学习率能跨宽度扩展的模型一致迁移。其次,我们通过建立一个预测性缩放定律(https://huggingface.co/papers?q=scaling%20law),将这种可迁移性扩展到 token 维度。通过对来自有限预算下小型代理模型的最优值进行线性回归,我们成功以高保真度(R²=0.95)将理想的学习率外推到大规模训练场景(例如 10 万亿 token)。因此,这表明在小型模型上进行代理训练足以确定大规模 MoE 模型广泛训练的最优学习率。我们将所提出的方法应用于从头预训练我们的基础模型(总参数 1550 亿,激活参数 170 亿),稳定的训练和评估结果验证了全规模目标模型的最优配置可以在最小消融成本下被准确预测。
查看 arXiv 页面 (https://arxiv.org/abs/2608.20061) 查看 PDF (https://arxiv.org/pdf/2608.20061) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.20061)
在您的 agent 中获取此论文:
hf papers read 2608.20061
没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash
引用此论文的模型数量:0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.20061 以从本页面链接。
引用此论文的数据集数量:0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.20061 以从本页面链接。
引用此论文的 Spaces 数量:0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.20061 以从本页面链接。
包含此论文的收藏数量:1
相似文章
如何扩展混合专家模型:从muP到最大化尺度稳定参数化
本文为混合专家(MoE)架构提出了一套具有理论基础的缩放理论,引入了最大化尺度稳定参数化(MSSP),确保在宽度、深度、专家宽度和专家数量上的稳定训练和超参数迁移,并通过实验验证。
LLM持续预训练中最佳超参数的可预测缩放规律
本文发现了LLM持续预训练中最佳超参数(学习率、批量大小)的可预测缩放规律,提出了一个两阶段框架,可将超参数搜索开销降低高达90%,同时保持性能。
@maximelabonne:量化超参数迁移与嵌入层学习率的重要性(第一张截图,Kalra 和 Ba…
本文介绍了一个量化大语言模型中超参数迁移的框架,并发现在使用 AdamW 训练时,μP 相对于 SP 的优势主要源于提高了嵌入层学习率。此外,还探讨了权重衰减及其他因素的影响。
扩展视野而非参数:以35B智能体达到万亿参数性能
介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。
计算最优并非集群最优:面向稀疏专家混合模型的系统感知扩展
本文介绍了MOSAIC,一个联合优化稀疏专家混合模型架构与硬件系统以支持大规模预训练的框架,表明在考虑MFU、通信成本和并行布局时,计算最优的稀疏性并不一定是集群最优的。