标签
Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。
一篇技术博客文章,剖析了 prime-rl 强化学习编排器的主循环,涵盖了 RolloutDispatcher、TrainSink、EvalSink、WeightWatcher 和 PeriodicLogger 等组件。
Prime Intellect 发布了 prime-rl v0.6.0,实现了万亿参数MoE规模的强化学习,每步时间低于5分钟,并优化了推理、训练和推出流程。