今天,我们发布了 verifiers v1(3分钟阅读)
摘要
Prime Intellect Lab 已结束测试,提供平台用于训练模型,支持多种架构和模态,助力自我改进的智能体。
Prime Intellect 的 verifiers v1 是对其环境堆栈的一次全面革新,以适应现代智能体强化学习和评估。它将环境分解为任务集、测试框架和运行时。verifiers v1 支持在任意测试框架中大规模执行编码和计算机使用等复杂智能体任务。
查看缓存全文
缓存时间: 2026/07/14 22:55
# @PrimeIntellect 在 Thread Reader App 上的推文
来源:https://threadreaderapp.com/thread/2076447247693402301.html
AI 的下一波浪潮不会靠更优的提示词取胜,而是靠那些能通过经验不断学习的系统。
今天,Prime Intellect Lab 结束内测,开放使用——现在你就可以开始训练自己的模型了。
自我改进的智能体时代已经来临。视频海报
以往,改进模型意味着等待前沿实验室的更新。
而 Lab 将模型改进引擎直接交到你手中:
构建。评估。训练。部署。图片 (https://pbs.twimg.com/media/HHr0r-hbEAA1R4J.jpg)
Lab 上线即支持来自 Nvidia、OpenAI、Meta、Qwen 等模型的自主服务,更多模型即将加入。
模型参数规模从 1B 到 400B 不等,覆盖密集型和 MoE 架构、推理与非推理模式,以及文本与图像模态。图片 (https://pbs.twimg.com/media/HHr0vo1a4AAKdcG.jpg)
相似文章
@samsja19: 我们同时发布了 prime-rl 0.7.0,它完全支持 verifiers v1 以及自带训练框架进行训练。……
Prime Intellect 发布了 verifiers v1 和 prime-rl 0.7.0,这是一个强化学习训练工具,完全支持 verifiers,包含多种算法如 GRPO 和 OPD,并进行了性能改进。
@h100envy: Prime Intellect工程师解释了如何在30分钟内通过开放互联网训练推理模型——比……更好
Prime Intellect工程师演示了一种方法,通过开放互联网使用分布式强化学习在30分钟内训练推理模型,利用Prime-RL、LLM评判器和多云GPU,使开放模型无需拥有数据中心即可与封闭实验室竞争。
@omarsar0: 值得收藏的新AI论文。这是我早期预言的,这篇论文证实了:验证已经出现……
这篇来自斯坦福大学、英伟达和加州大学伯克利分校的论文介绍了LLM-as-a-Verifier,一种无需训练的验证框架,利用LLM logits的连续评分来提高编码、机器人和医疗领域的准确性,在多个基准上取得了最先进的结果。
@gurtej__gill_: 来自斯坦福、伯克利和NVIDIA的这篇新论文感觉像是测试时计算拼图中至关重要的一块……
这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。
@samsja19: prime-rl 现在可以极快地训练1T参数的MoE模型,每步不到5分钟,约3天完成1000步。为实现这一...
Prime Intellect 发布了 prime-rl v0.6.0,实现了万亿参数MoE规模的强化学习,每步时间低于5分钟,并优化了推理、训练和推出流程。