@samsja19: 与多智能体一起到来的还有 prime-rl 0.8.0 版本,自 0.7.0 以来共有 13 位贡献者提交了 98 个 commit,菜单上有:1. 多智能体…
摘要
Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。
查看缓存全文
缓存时间: 2026/08/08 05:05
多智能体功能伴随着 prime-rl 0.8.0 版本发布而来,自 0.7.0 以来共有 13 位贡献者提交了 98 个提交
主要内容:
- 多智能体训练与算法
- Nixl 与模型快速权重广播(对 glm5 仅需数秒)
- 扩展的多模态支持(VLM SFT、VLM 上下文并行)
- 许多其他性能改进与错误修复
Prime Intellect (@PrimeIntellect): 今天,我们正在将强化学习(RL)技术栈从单个智能体扩展到多智能体系统。
现在,您可以表达任意的智能体交互并对它们进行训练。
相似文章
@samsja19:Prime RL 现在可以表示和训练多智能体系统,支持智能体裁判、自我对弈、用户模拟等用例…
Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。
@samsja19: 我们同时发布了 prime-rl 0.7.0,它完全支持 verifiers v1 以及自带训练框架进行训练。……
Prime Intellect 发布了 verifiers v1 和 prime-rl 0.7.0,这是一个强化学习训练工具,完全支持 verifiers,包含多种算法如 GRPO 和 OPD,并进行了性能改进。
Prime Agent:一个自我改进的RLM智能体
Prime Intellect 推出 Prime Agent,这是一个完全开源、自我改进的编码工具(harness),围绕递归语言模型(RLM)和 Continual Harness 抽象构建,通过基于 REPL 的接口实现持久子智能体和动态工具。
@samsja19: prime-rl 现在可以极快地训练1T参数的MoE模型,每步不到5分钟,约3天完成1000步。为实现这一...
Prime Intellect 发布了 prime-rl v0.6.0,实现了万亿参数MoE规模的强化学习,每步时间低于5分钟,并优化了推理、训练和推出流程。
@latkins: 哟
Prime Intellect 推出了 Prime Agent,一个用于编程和长期自主任务的自我改进型 RLM 框架,具备程序化工具调用、将上下文作为变量、多智能体消息传递以及可自我修改的框架状态等特点。