一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

Hugging Face Daily Papers 论文

摘要

本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。

现代大规模LLM预训练受益于流水线并行的使用;然而,同步实现在流水线气泡期间使GPU闲置,浪费计算资源。异步流水线并行消除了这些气泡,以梯度陈旧为代价最大化吞吐量。在异步调度中,PipeDream-2BW尤其引人注目:与原始PipeDream调度不同,它确保了无论流水线深度如何,都保持恒定的单步梯度延迟。然而,由于其采用仍然有限,因为普遍认为在陈旧梯度下优化本质上是不稳定的。在这项工作中,我们挑战了这一假设,证明单步延迟下的性能下降强烈依赖于优化器的选择,而非内在限制。我们首次提供了全面的实证分析,表明虽然AdamW(在PipeDream-2BW引入时的主要优化器)确实遭受严重性能下降,但像Muon这样的最新方法在单步延迟下表现出强大的鲁棒性。我们引入了一种与优化器无关的基于误差反馈的修正方法,以进一步减轻延迟效应。我们提供了支持性理论分析,证明Muon在有无该修正的情况下均能收敛。对高达10B参数的模型进行的广泛评估证实,我们的策略弥补了与同步训练的性能差距,突显了异步流水线并行在大规模应用中的实际潜力。
查看原文
查看缓存全文

缓存时间: 2026/06/30 15:37

论文页面 - 单步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

来源:https://huggingface.co/papers/2606.30634

摘要

采用 PipeDream-2BW 的异步流水线并行可通过优化器选择和误差反馈校正实现近乎同步的性能,克服了传统稳定性问题。

现代大规模 LLM 预训练得益于流水线并行的应用;然而,同步实现在流水线气泡期间使 GPU 处于空闲状态,浪费了计算资源。异步流水线并行消除了这些气泡,以梯度陈旧为代价最大化吞吐量。在异步调度中,PipeDream-2BW 尤其引人注目:与原始 PipeDream 调度不同,它确保无论流水线深度如何,梯度延迟始终为单步。然而,由于普遍认为在陈旧条件下进行优化本质上不稳定,其应用仍然有限。在本工作中,我们挑战了这一假设,证明单步延迟下的性能退化主要取决于优化器选择,而非内在限制。我们首次提供了全面的实证分析,表明虽然 AdamW(PipeDream-2BW 提出时的主流优化器)确实遭受严重退化,但诸如 Muon 等近期方法在单步延迟下表现出强大的鲁棒性。我们引入了一种与优化器无关的、受误差反馈启发的校正方法,以进一步减轻延迟影响。我们提供了支持性理论分析,证明了 Muon 在有/无该校正情况下的收敛性。对高达 10B 参数的模型进行的广泛评估证实,我们的策略弥合了与同步训练之间的性能差距,凸显了异步流水线并行在大规模应用中的实际潜力。

查看 arXiv 页面 (https://arxiv.org/abs/2606.30634) 查看 PDF (https://arxiv.org/pdf/2606.30634) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30634)

通过你的代理获取此论文:

hf papers read 2606\.30634

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.30634 即可从此页面链接。

引用该论文的数据集 0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.30634 即可从此页面链接。

引用该论文的 Space 0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.30634 即可从此页面链接。

包含该论文的收藏 0

暂无收藏包含此论文

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接。

相似文章

SOAP、Muon 及更多:推动LLM预训练规模扩展

arXiv cs.LG

本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。

大步长梯度下降恢复多路径深度线性网络中的对称性

arXiv cs.LG

本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。