标签
本文改进了高阶优化器 SOAP 和 Muon,用于大规模 LLM 预训练,解决了大批量训练中的不稳定性问题,并引入了一种与 Megatron-LM 兼容的层式分布式优化器。实验表明,在数十亿参数规模下,它们始终优于 AdamW。
35B-A6B 模型的开发者报告获得了一台配备 768GB 显存和 1.5TB 内存的强大服务器,能够进行全面评估和大规模调优。这一突破加速了高质量 AI 模型的开发。
本文作者分享了从nnScaler到大规模分布式训练系统的经验与思考,讨论了训练系统的正确性、灵活性、边界扩展以及后训练与强化学习带来的挑战。
OmniOpt 提出了一个用于大规模模型训练中优化器选择的统一框架,该框架结合了元流水线变换、范数约束的线性最小化预言机以及跨领域基准,以系统分析优化器家族及其权衡。
Prime Intellect发布了prime-rl v0.6.0,支持在万亿参数规模的大型Mixture-of-Experts模型上进行高效强化学习,实现低于5分钟的步骤时间,并对异步强化学习进行了优化。
Miles 是一个企业级强化学习框架,专为大规模模型后训练设计,特点是通过 SGLang 实现高性能 rollout,并借助 Megatron-LM 提供可扩展训练能力。