gradient-staleness

标签

Cards List
#gradient-staleness

一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

Hugging Face Daily Papers · 2026-06-29 缓存

本文挑战了异步流水线并行中一步梯度延迟天生不稳定的假设,表明性能下降取决于优化器的选择。研究证明,Muon等优化器对一步延迟具有鲁棒性,并引入了一种基于误差反馈的修正方法以进一步缓解陈旧的梯度问题,在高达10B参数的LLM预训练中实现了接近同步训练的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈