标签
这篇来自清华大学的论文提出了单次展开异步优化 (SAO, Single-rollout Asynchronous Optimization),用于大语言模型的强化学习后训练。SAO 用单次展开异步训练取代了基于批次的 GRPO,以减少 GPU 空闲时间并提高稳定性。该技术被用于训练 GLM-5.2 模型(750B-A40B),在智能体编程和推理基准测试上取得了最先进的结果。
本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。
清华大学的SAO算法解决了大规模语言模型异步强化学习中的稳定性和离策略漂移问题,在智能体编程和推理基准测试上相比GRPO取得了稳定提升,并用于训练GLM-5.2模型。
Prime Intellect发布了prime-rl v0.6.0,支持在万亿参数规模的大型Mixture-of-Experts模型上进行高效强化学习,实现低于5分钟的步骤时间,并对异步强化学习进行了优化。
一篇探讨异步强化学习中权重同步技术的博客文章,涵盖了不同框架下传输和负载的权衡。
Luke J. Huang 的新博客文章调研了异步强化学习理论与基础设施,涵盖 8 家开放权重前沿实验室,并讨论了算法技术以及针对训练-推理不匹配的系统修复方案。