打破气泡:具有有界权重不一致性的异步流水线并行训练
摘要
介绍 PACI,一种无气泡的异步流水线并行训练方法,通过局部梯度累积来约束前向/后向权重不一致性,在保持稳定性和内存使用不变的情况下,实现更高的吞吐量和更快的达到目标精度时间。
查看缓存全文
缓存时间: 2026/06/11 13:37
论文页面 - 打破泡沫:具有有界权重不一致性的异步管道并行训练
来源:https://huggingface.co/papers/2606.07881
摘要
PACI 通过本地梯度累积控制前向/后向权重不一致性,实现了高效的异步管道训练,在更高吞吐量和更快训练收敛速度的同时,不牺牲稳定性或内存使用。
管道并行性 (https://huggingface.co/papers?q=Pipeline%20parallelism) 对于训练大型神经网络至关重要,但现有调度方案在吞吐量、内存和优化一致性之间存在权衡。同步管道 (https://huggingface.co/papers?q=Synchronous%20pipelines) 保持了前向/后向权重的一致性,但会引入泡沫;异步管道 (https://huggingface.co/papers?q=asynchronous%20pipelines) 消除了泡沫,但引入了权重版本不匹配的问题,通常需要权重暂存 (https://huggingface.co/papers?q=weight%20stashing)、预测或校正机制。我们引入了 PACI(带有可控不一致性的管道异步训练),这是一种无泡沫的异步管道方法,可在无需权重暂存 (https://huggingface.co/papers?q=weight%20stashing)、预测、额外的参数副本或全局同步的情况下,限制前向/后向版本的漂移。关键思想是利用本地梯度累积 (https://huggingface.co/papers?q=gradient%20accumulation) 作为版本控制机制:通过相对于管道延迟减慢参数版本的演进速度,PACI 限制了任何微批次所跨越的优化器更新 (https://huggingface.co/papers?q=optimizer%20updates) 数量,同时保持了稳态利用率 (https://huggingface.co/papers?q=steady-state%20utilization)。在 GPT 风格的语言模型预训练 (https://huggingface.co/papers?q=GPT-style%20language-model%20pretraining) 中,PACI 在稳定性和最终困惑度上与同步的 1F1B-flush (https://huggingface.co/papers?q=1F1B-flush) 相匹配,保持相同的峰值内存占用 (https://huggingface.co/papers?q=peak%20memory%20footprint),实现了完全利用的管道吞吐量,并且相比最快的 flush 基线,训练收敛速度最高提升 1.69 倍。这些结果表明,前向/后向不一致性无需被消除:当受到明确定界时,它可以安全地换取显著的效率提升。
查看 arXiv 页面 (https://arxiv.org/abs/2606.07881)查看 PDF (https://arxiv.org/pdf/2606.07881)GitHub2 (https://github.com/ItayElam/PACI)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07881)
在你的代理中获取此论文:
hf papers read 2606\.07881
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.07881 以从本页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.07881 以从本页面链接它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.07881 以从本页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集中 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍
本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。
推测性流水线解码:通过流水线并行实现更高准确度和零泡沫推测
本文提出推测性流水线解码(SPD),一种在单个LLM内部利用流水线并行实现并行令牌推测的框架,避免了传统推测解码中多令牌预测的延迟泡沫和准确度下降问题。
PASC:面向多阶段NLP和LLM流水线的具有联合覆盖保证的流水线感知共形预测
PASC提出了一种用于多阶段NLP和LLM流水线的共形预测方法,该方法提供跨所有阶段的有限样本、无分布假设的联合覆盖保证,相比Bonferroni和独立CP等基线方法,实现了更高的经验覆盖率和效率。
@YuvrajS9886: 在数据并行之后,我们转向模型并行,从流水线并行开始。论文:GPipe:使用微批处理轻松扩展…
本线程解释了GPipe,这是一篇关于使用微批处理和激活检查点技术跨多个GPU扩展大模型的流水线并行论文。
在连续批处理中实现异步性
本文解释了如何为LLM推理实现异步连续批处理,将CPU批处理准备与GPU计算重叠,以最大化利用率并减少空闲时间。