逐步扩展:大规模 Mixture-of-Experts 的计算高效超参数迁移

Hugging Face Daily Papers 论文

摘要

本文提出了一种计算高效的两步超参数迁移框架,用于预测大型 Mixture-of-Experts 模型的最优学习率,从而无需昂贵的超参数搜索即可实现高效预训练。

Mixture-of-Experts (MoE) 架构显著扩展模型容量,而不会按比例增加计算成本。然而,通过搜索在极端规模(模型大小和令牌预算)下优化其超参数——尤其是学习率——在计算上仍然不可行。本文提出了一种计算高效的两步超参数迁移框架,该框架通过跨模型宽度迁移并随后外推至万亿令牌范围,来估计训练大型 MoE 模型的最优学习率。首先,我们为使用多头潜在注意力 (MLA) 和 Muon 优化器的 MoE 架构制定了最大更新参数化 (μP) 适配,证明最优学习率在宽度缩放模型间一致迁移。其次,我们通过建立预测缩放定律,将这种可迁移性扩展到令牌维度。通过对有限预算上小型代理模型导出的最优值应用线性回归,我们成功地将理想学习率外推至大规模训练范围(例如,10万亿令牌),并保持高保真度 (R^2=0.95)。因此,这表明在小型模型上进行代理训练足以确定大型 MoE 广泛训练的最优学习率。我们将所提出的方法应用于从头预训练我们的基础模型(总计155B,活跃参数17B),稳定的训练和评估结果验证了全规模目标模型的最优配置可以以最小的消融成本准确预测。
查看原文
查看缓存全文

缓存时间: 2026/08/24 08:28

论文页面 - 循序渐进地扩展:面向大规模混合专家模型的计算高效超参数迁移

来源:https://huggingface.co/papers/2608.20061

摘要

一种两步超参数迁移框架,通过在不同宽度和 token 预算间进行扩展,预测大规模混合专家模型的最优学习率,从而实现无需昂贵搜索的高效预训练。

混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)(MoE)架构能在不成比例增加计算成本的情况下显著扩大模型容量。然而,在模型大小和 token 预算都达到极端规模时,通过搜索来优化其超参数——尤其是学习率——在计算上仍然代价高昂。在本文中,我们提出了一种计算高效的两步超参数迁移(https://huggingface.co/papers?q=hyperparameter%20transfer)框架。该框架通过在不同扩展的模型宽度间进行迁移,随后向万亿 token 规模外推,来估计训练大型 MoE 模型的最优学习率。首先,我们为采用多头潜在注意力(https://huggingface.co/papers?q=Multi-head%20Latent%Attention)(MLA)和 Muon 优化器(https://huggingface.co/papers?q=Muon%20optimizer)的 MoE 架构制定了最大更新参数化(https://huggingface.co/papers?q=Maximal%20Update%20Parameterization)(μP)适配方案,并证明最优学习率能跨宽度扩展的模型一致迁移。其次,我们通过建立一个预测性缩放定律(https://huggingface.co/papers?q=scaling%20law),将这种可迁移性扩展到 token 维度。通过对来自有限预算下小型代理模型的最优值进行线性回归,我们成功以高保真度(R²=0.95)将理想的学习率外推到大规模训练场景(例如 10 万亿 token)。因此,这表明在小型模型上进行代理训练足以确定大规模 MoE 模型广泛训练的最优学习率。我们将所提出的方法应用于从头预训练我们的基础模型(总参数 1550 亿,激活参数 170 亿),稳定的训练和评估结果验证了全规模目标模型的最优配置可以在最小消融成本下被准确预测。

查看 arXiv 页面 (https://arxiv.org/abs/2608.20061) 查看 PDF (https://arxiv.org/pdf/2608.20061) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.20061)

在您的 agent 中获取此论文:

hf papers read 2608.20061

没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash

引用此论文的模型数量:0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.20061 以从本页面链接。

引用此论文的数据集数量:0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.20061 以从本页面链接。

引用此论文的 Spaces 数量:0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.20061 以从本页面链接。

包含此论文的收藏数量:1

相似文章

扩展视野而非参数:以35B智能体达到万亿参数性能

Hugging Face Daily Papers

介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。