标签
本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。
介绍 PACI,一种无气泡的异步流水线并行训练方法,通过局部梯度累积来约束前向/后向权重不一致性,在保持稳定性和内存使用不变的情况下,实现更高的吞吐量和更快的达到目标精度时间。