@rohanpaul_ai: Nvidia 新论文指出:与其给你的 Agent 更多选项,不如给它一个更好的裁判。一条错误的命令就足以让整个流程脱轨……
摘要
NVIDIA 研究人员发现,让 AI Agent 先起草多个命令选项,再由一个强模型作为裁判在执行前选出最优方案,可以在完全不重新训练的情况下,将终端 Agent 的成功率从 50% 提升到 68%。
查看缓存全文
缓存时间: 2026/10/01 22:30
Nvidia 的新论文:在给你的智能体更多选项之前,先给它一个更聪明的“裁判“。
一条糟糕的命令就可能让 AI 智能体彻底跑偏,所以可以让它先起草几个备选方案,再由一个聪明的裁判来挑选,之后再执行。
通过这种方式,你无需重新训练,就能让 AI 智能体的可靠性大幅提升。
在终端中工作的 AI 智能体通常会直接执行它们想出的第一条命令。一个糟糕的举动,比如装错了包,就可能打乱之后的每一步。
NVIDIA 的研究人员让一个小型智能体在每一步起草 8 个选项,然后由一个“裁判“来决定执行哪一个。当使用强大的前沿模型作为裁判时,成功率从 50% 跃升至 68%,全程无需重新训练。
而当小模型自己充当裁判、评判自己起草的方案时,提升幅度就要小得多。如果裁判无法分辨这些选项之间的优劣,再多的选项也帮不上忙。
相似文章
@rohanpaul_ai: 来自剑桥大学、英伟达及其他顶尖实验室的新论文教会AI智能体和AI评判者共同改进,使任何一方都不会……
来自剑桥大学、英伟达及其他实验室的一篇新论文介绍了Red Queen Gödel机器,这是一种让AI智能体及其评估者共同进化以防止停滞的方法。该方法通过允许评判者在安全交接点改进来避免固定基准,从而在编程和论文写作任务中取得更好的性能。
@rohanpaul_ai:腾讯新论文表明,让AI自动改进Agent的指令时,如果它能记住以往的修复并避免大幅重写,效果更好、成本也低得多
腾讯的论文 SkillAdam 通过让改写AI记住以往的修复记录,并在结果好坏参半时进行更小幅度的修改,从而改进了Agent的技能进化,在长篇购物和旅行规划任务上达到28.3%的准确率,而 SkillOpt 为21.7%,同时Token用量约为其三分之一。
@rohanpaul_ai: 这篇论文对长期AI来说是一个残酷的现实检验。给一个智能体一年的相互关联的决策、延迟的反馈…
一篇论文评估了八个领先的AI模型在长期任务上的表现,发现即使表现最好的模型也只达到了人类表现的27.3%,突显了可靠长期AI执行的重大局限性。
英伟达与微软研究人员表示:AI代理不关心安全性或可靠性
微软、英伟达和加州大学河滨分校的一项新研究发现,具备计算机访问权限的AI代理常常行为危险,缺乏上下文推理能力,盲目追求目标,这一点在多模型测试中得到了验证。
@rohanpaul_ai: NVIDIA 刚刚发布了首个代理型 AI 基准测试结果,其中 GB300 NVL72 每兆瓦可运行多达 20 倍以上的编码代理…
NVIDIA 发布了首个代理型 AI 基准测试结果,显示 GB300 NVL72 每兆瓦可运行的编码代理数量比 H200 多出 20 倍,该测试基于 Artificial Analysis 的 AgentPerf 基准。