@rohanpaul_ai: Nvidia 新论文指出:与其给你的 Agent 更多选项,不如给它一个更好的裁判。一条错误的命令就足以让整个流程脱轨……

X AI KOLs Timeline 论文

摘要

NVIDIA 研究人员发现,让 AI Agent 先起草多个命令选项,再由一个强模型作为裁判在执行前选出最优方案,可以在完全不重新训练的情况下,将终端 Agent 的成功率从 50% 提升到 68%。

Nvidia 的新论文指出:与其给你的 Agent 更多选项,不如给它一个更好的裁判。 一条错误的命令就足以让 AI Agent 脱轨,所以让它先起草几个选项,再由一个聪明的裁判在执行前做出选择。 通过这种方式,你无需重新训练,就能让 AI Agent 变得可靠得多。 在终端中工作的 AI Agent 通常会直接执行它想到的第一条命令。一个错误的操作,比如安装了错误的软件包,就可能打乱之后的每一步。 NVIDIA 研究人员让一个小型 Agent 在每一步都起草 8 个选项,并让一个裁判来决定执行哪一个。当使用强大的前沿模型作为裁判时,成功率从 50% 跳升到 68%,而且完全不需要重新训练。 当小模型自己评判自己起草的方案时,提升幅度就小得多。如果裁判无法区分各个选项的优劣,再多的选项也无济于事。
查看原文
查看缓存全文

缓存时间: 2026/10/01 22:30

Nvidia 的新论文:在给你的智能体更多选项之前,先给它一个更聪明的“裁判“。

一条糟糕的命令就可能让 AI 智能体彻底跑偏,所以可以让它先起草几个备选方案,再由一个聪明的裁判来挑选,之后再执行。

通过这种方式,你无需重新训练,就能让 AI 智能体的可靠性大幅提升。

在终端中工作的 AI 智能体通常会直接执行它们想出的第一条命令。一个糟糕的举动,比如装错了包,就可能打乱之后的每一步。

NVIDIA 的研究人员让一个小型智能体在每一步起草 8 个选项,然后由一个“裁判“来决定执行哪一个。当使用强大的前沿模型作为裁判时,成功率从 50% 跃升至 68%,全程无需重新训练。

而当小模型自己充当裁判、评判自己起草的方案时,提升幅度就要小得多。如果裁判无法分辨这些选项之间的优劣,再多的选项也帮不上忙。

相似文章

@rohanpaul_ai: 来自剑桥大学、英伟达及其他顶尖实验室的新论文教会AI智能体和AI评判者共同改进,使任何一方都不会……

X AI KOLs Following

来自剑桥大学、英伟达及其他实验室的一篇新论文介绍了Red Queen Gödel机器,这是一种让AI智能体及其评估者共同进化以防止停滞的方法。该方法通过允许评判者在安全交接点改进来避免固定基准,从而在编程和论文写作任务中取得更好的性能。