@NVIDIAAI: 我们为一个编码智能体设定了目标与时间预算:构建训练环境并教会视觉模型数彩色星星…

X AI KOLs Timeline 新闻

摘要

NVIDIA 展示了一个编码智能体,它自主构建了训练环境并教会 Qwen3-VL-2B 数彩色星星,使用 NeMo RL 和 NeMo Gym 框架将准确率从 25% 提升至 96.9%。

我们为一个编码智能体设定了目标与时间预算:构建训练环境并教会视觉模型数彩色星星。 利用与 NeMo RL、NeMo Gym 和可复用技能相结合的自动研究,该智能体设置、训练并评估了模型,同时研究人员指导工作。 Qwen3-VL-2B 的准确率从 25% 提升至 96.9%,智能体甚至自主提出了下一个实验。
查看原文
查看缓存全文

缓存时间: 2026/07/14 16:28

我们给一个编码代理设定了目标和时间预算:构建一个训练环境,并教会一个视觉模型数彩色星星。

借助NeMo RL、NeMo Gym和可复用技能进行自动研究,该代理在研究人员引导下,完成了从环境搭建、模型训练到评估的全过程。

Qwen3-VL-2B的准确率从25%提升至96.9%,并且代理甚至自主提出了下一个实验方案。

相似文章

@rohanpaul_ai: 来自剑桥大学、英伟达及其他顶尖实验室的新论文教会AI智能体和AI评判者共同改进,使任何一方都不会……

X AI KOLs Following

来自剑桥大学、英伟达及其他实验室的一篇新论文介绍了Red Queen Gödel机器,这是一种让AI智能体及其评估者共同进化以防止停滞的方法。该方法通过允许评判者在安全交接点改进来避免固定基准,从而在编程和论文写作任务中取得更好的性能。