打破气泡:具有有界权重不一致性的异步流水线并行训练

Hugging Face Daily Papers 论文

摘要

介绍 PACI,一种无气泡的异步流水线并行训练方法,通过局部梯度累积来约束前向/后向权重不一致性,在保持稳定性和内存使用不变的情况下,实现更高的吞吐量和更快的达到目标精度时间。

流水线并行对于训练大型神经网络至关重要,但现有的调度方案在吞吐量、内存和优化一致性之间进行权衡。同步流水线保持了前向/后向权重一致性,但存在气泡问题;异步流水线消除了气泡,但引入了权重版本不匹配问题,通常需要权重暂存、预测或修正机制。我们提出 PACI(具有受控不一致性的流水线异步训练),一种无气泡的异步流水线方法,它在没有权重暂存、预测、额外参数副本或全局同步的情况下约束前向/后向版本漂移。关键思想是使用局部梯度累积作为版本控制机制:通过相对于流水线延迟减慢参数版本的演化,PACI限制了任何微批次所经历的优化器更新次数,同时保持稳态利用率。在GPT风格的语言模型预训练中,PACI与同步1F1B-flush的稳定性和最终困惑度相匹配,保持相同的峰值内存占用,实现完全利用的流水线吞吐量,并且与最快的刷新基线相比,训练达到目标精度的时间最多提升1.69倍。这些结果表明,前向/后向不一致性不必被消除:当被明确约束时,可以安全地将其换取显著的效率提升。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:37

论文页面 - 打破泡沫:具有有界权重不一致性的异步管道并行训练

来源:https://huggingface.co/papers/2606.07881

摘要

PACI 通过本地梯度累积控制前向/后向权重不一致性,实现了高效的异步管道训练,在更高吞吐量和更快训练收敛速度的同时,不牺牲稳定性或内存使用。

管道并行性 (https://huggingface.co/papers?q=Pipeline%20parallelism) 对于训练大型神经网络至关重要,但现有调度方案在吞吐量、内存和优化一致性之间存在权衡。同步管道 (https://huggingface.co/papers?q=Synchronous%20pipelines) 保持了前向/后向权重的一致性,但会引入泡沫;异步管道 (https://huggingface.co/papers?q=asynchronous%20pipelines) 消除了泡沫,但引入了权重版本不匹配的问题,通常需要权重暂存 (https://huggingface.co/papers?q=weight%20stashing)、预测或校正机制。我们引入了 PACI(带有可控不一致性的管道异步训练),这是一种无泡沫的异步管道方法,可在无需权重暂存 (https://huggingface.co/papers?q=weight%20stashing)、预测、额外的参数副本或全局同步的情况下,限制前向/后向版本的漂移。关键思想是利用本地梯度累积 (https://huggingface.co/papers?q=gradient%20accumulation) 作为版本控制机制:通过相对于管道延迟减慢参数版本的演进速度,PACI 限制了任何微批次所跨越的优化器更新 (https://huggingface.co/papers?q=optimizer%20updates) 数量,同时保持了稳态利用率 (https://huggingface.co/papers?q=steady-state%20utilization)。在 GPT 风格的语言模型预训练 (https://huggingface.co/papers?q=GPT-style%20language-model%20pretraining) 中,PACI 在稳定性和最终困惑度上与同步的 1F1B-flush (https://huggingface.co/papers?q=1F1B-flush) 相匹配,保持相同的峰值内存占用 (https://huggingface.co/papers?q=peak%20memory%20footprint),实现了完全利用的管道吞吐量,并且相比最快的 flush 基线,训练收敛速度最高提升 1.69 倍。这些结果表明,前向/后向不一致性无需被消除:当受到明确定界时,它可以安全地换取显著的效率提升。

查看 arXiv 页面 (https://arxiv.org/abs/2606.07881)查看 PDF (https://arxiv.org/pdf/2606.07881)GitHub2 (https://github.com/ItayElam/PACI)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07881)

在你的代理中获取此论文:

hf papers read 2606\.07881

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.07881 以从本页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.07881 以从本页面链接它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.07881 以从本页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集中 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

Hugging Face Daily Papers

本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。

在连续批处理中实现异步性

Hugging Face Blog

本文解释了如何为LLM推理实现异步连续批处理,将CPU批处理准备与GPU计算重叠,以最大化利用率并减少空闲时间。