一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍
摘要
本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。
查看缓存全文
缓存时间: 2026/06/30 15:37
论文页面 - 单步梯度延迟并非大规模异步流水线并行LLM预训练的障碍
来源:https://huggingface.co/papers/2606.30634
摘要
采用 PipeDream-2BW 的异步流水线并行可通过优化器选择和误差反馈校正实现近乎同步的性能,克服了传统稳定性问题。
现代大规模 LLM 预训练得益于流水线并行的应用;然而,同步实现在流水线气泡期间使 GPU 处于空闲状态,浪费了计算资源。异步流水线并行消除了这些气泡,以梯度陈旧为代价最大化吞吐量。在异步调度中,PipeDream-2BW 尤其引人注目:与原始 PipeDream 调度不同,它确保无论流水线深度如何,梯度延迟始终为单步。然而,由于普遍认为在陈旧条件下进行优化本质上不稳定,其应用仍然有限。在本工作中,我们挑战了这一假设,证明单步延迟下的性能退化主要取决于优化器选择,而非内在限制。我们首次提供了全面的实证分析,表明虽然 AdamW(PipeDream-2BW 提出时的主流优化器)确实遭受严重退化,但诸如 Muon 等近期方法在单步延迟下表现出强大的鲁棒性。我们引入了一种与优化器无关的、受误差反馈启发的校正方法,以进一步减轻延迟影响。我们提供了支持性理论分析,证明了 Muon 在有/无该校正情况下的收敛性。对高达 10B 参数的模型进行的广泛评估证实,我们的策略弥合了与同步训练之间的性能差距,凸显了异步流水线并行在大规模应用中的实际潜力。
查看 arXiv 页面 (https://arxiv.org/abs/2606.30634) 查看 PDF (https://arxiv.org/pdf/2606.30634) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30634)
通过你的代理获取此论文:
hf papers read 2606\.30634
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.30634 即可从此页面链接。
引用该论文的数据集 0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.30634 即可从此页面链接。
引用该论文的 Space 0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.30634 即可从此页面链接。
包含该论文的收藏 0
暂无收藏包含此论文
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接。
相似文章
SOAP、Muon 及更多:推动LLM预训练规模扩展
本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。
打破气泡:具有有界权重不一致性的异步流水线并行训练
介绍 PACI,一种无气泡的异步流水线并行训练方法,通过局部梯度累积来约束前向/后向权重不一致性,在保持稳定性和内存使用不变的情况下,实现更高的吞吐量和更快的达到目标精度时间。
DynaTrain: 面向弹性大语言模型训练的快速在线并行度切换
DynaTrain 是一个分布式训练系统,能够在大语言模型上实现亚秒级在线并行度重配置,通过虚拟参数空间抽象,使转换速度比现有方法快多达三个数量级。
LLM持续预训练中最佳超参数的可预测缩放规律
本文发现了LLM持续预训练中最佳超参数(学习率、批量大小)的可预测缩放规律,提出了一个两阶段框架,可将超参数搜索开销降低高达90%,同时保持性能。
大步长梯度下降恢复多路径深度线性网络中的对称性
本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。