@samsja19: prime-rl 现在可以极快地训练1T参数的MoE模型,每步不到5分钟,约3天完成1000步。为实现这一...
摘要
Prime Intellect 发布了 prime-rl v0.6.0,实现了万亿参数MoE规模的强化学习,每步时间低于5分钟,并优化了推理、训练和推出流程。
查看缓存全文
缓存时间: 2026/06/23 15:52
prime-rl 现在可以以闪电般的速度训练1T参数的MoE模型,每步不到5分钟,即约3天完成1k步。
为此,我们在最新的prime-rl 0.6.0中推出了:
-
推理:wide-ep、fp8推理、llm-d路由器、mooncake、kv缓存CPU卸载
-
训练:fsdp2、deep-ep专家并行、dsa cp、fp8训练、路由器重放
-
代理化部署:重写了部署编排器的核心以提高可扩展性
支持glm5、kimi、nemotron等
prime-rl是开源的,但也经过端到端优化,可在我们的专用RL基础设施和计算层上运行
Prime Intellect (@PrimeIntellect): 今天,我们发布了prime-rl v0.6.0——能够在万亿参数MoE规模上以最高效率进行代理化工作负载下的RL。
我们坚持不懈地优化了RL基础设施。
成果:GLM-5在代理化SWE任务上,上下文长度131k,步长时间低于5分钟。
相似文章
@eliebakouch: 在GLM-5上进行强化学习所需了解的所有基础设施内容 https://primeintellect.ai/blog/rl-at-1t-scale…
Prime Intellect发布了prime-rl v0.6.0,支持在万亿参数规模的大型Mixture-of-Experts模型上进行高效强化学习,实现低于5分钟的步骤时间,并对异步强化学习进行了优化。
@samsja19: 与多智能体一起到来的还有 prime-rl 0.8.0 版本,自 0.7.0 以来共有 13 位贡献者提交了 98 个 commit,菜单上有:1. 多智能体…
Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。
@h100envy: Prime Intellect工程师解释了如何在30分钟内通过开放互联网训练推理模型——比……更好
Prime Intellect工程师演示了一种方法,通过开放互联网使用分布式强化学习在30分钟内训练推理模型,利用Prime-RL、LLM评判器和多云GPU,使开放模型无需拥有数据中心即可与封闭实验室竞争。
@samsja19: https://x.com/samsja19/status/2076846033922035818
PRIME-RL是一个用于大规模异步强化学习的框架,设计上易于定制,可扩展至1000+块GPU,并支持多种模型和环境。
@samsja19: 我们同时发布了 prime-rl 0.7.0,它完全支持 verifiers v1 以及自带训练框架进行训练。……
Prime Intellect 发布了 verifiers v1 和 prime-rl 0.7.0,这是一个强化学习训练工具,完全支持 verifiers,包含多种算法如 GRPO 和 OPD,并进行了性能改进。