@samsja19: 我们同时发布了 prime-rl 0.7.0,它完全支持 verifiers v1 以及自带训练框架进行训练。……
摘要
Prime Intellect 发布了 verifiers v1 和 prime-rl 0.7.0,这是一个强化学习训练工具,完全支持 verifiers,包含多种算法如 GRPO 和 OPD,并进行了性能改进。
我们还发布了 prime-rl 0.7.0,它完全支持 verifiers v1 以及自带训练框架进行训练。
我们已经在生产环境中进行了数周的实战测试,菜单上包括:
* Verifiers v1 集成
* 完整的算法层(GRPO、OPD、OPSD、SFT、ECHO)
* 大量性能改进和更合理的默认设置
查看缓存全文
缓存时间: 2026/07/14 04:26
我们还发布了 prime-rl 0.7.0 版本,该版本完整支持验证器 v1,并允许用户自定训练框架。
该版本已通过数周生产环境实战检验,菜单内容如下:
- 验证器 v1 集成
- 完整算法层(GRPO、OPD、OPSD、SFT、ECHO)
- 多项性能改进及更合理的默认配置
已投入生产环境
相似文章
今天,我们发布了 verifiers v1(3分钟阅读)
Prime Intellect Lab 已结束测试,提供平台用于训练模型,支持多种架构和模态,助力自我改进的智能体。
@samsja19: 与多智能体一起到来的还有 prime-rl 0.8.0 版本,自 0.7.0 以来共有 13 位贡献者提交了 98 个 commit,菜单上有:1. 多智能体…
Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。
@samsja19: prime-rl 现在可以极快地训练1T参数的MoE模型,每步不到5分钟,约3天完成1000步。为实现这一...
Prime Intellect 发布了 prime-rl v0.6.0,实现了万亿参数MoE规模的强化学习,每步时间低于5分钟,并优化了推理、训练和推出流程。
@samsja19:我们在 prime rl 中花了大量时间设计优雅的算法 API,既富有表现力又可扩展,同时不牺牲性能……
Prime-rl 增加了一个一级算法层,内置六种 RL 算法(GRPO、MaxRL、OPD、OPSD、SFT、ECHO),使得通过单个文件实现自定义算法变得更加容易。
@samsja19: https://x.com/samsja19/status/2076846033922035818
PRIME-RL是一个用于大规模异步强化学习的框架,设计上易于定制,可扩展至1000+块GPU,并支持多种模型和环境。