@h100envy: 这篇论文彻底改变了我对自主工程智能体的看法:给智能体一个界面,而不是bash -> ...
摘要
本文介绍了针对自主编码智能体的智能体-计算机接口(ACI),用专为导航、编辑和反馈设计的命令取代原始bash,在SWE-bench和HumanEvalFix上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/07/11 21:29
这篇论文彻底改变了我对自主工程智能体的认知:
给智能体一个接口,而非bash终端 → 浏览仓库 → 通过智能体命令编辑文件 → 运行测试 → 将环境反馈重新注入循环
以下是5步蓝图:
ACI(智能体-计算机接口):智能体获得的不是原始终端,而是一个按需定制的智能体-计算机接口,配备适合其需求的命令,就像人类获得IDE一样。
导航:用文件与仓库级搜索命令替代盲目的grep,让智能体准确找到目标位置,无需四处游荡。
编辑:文件编辑通过智能体命令完成,使用有边界的窗口,而非倾倒整个文件。 护栏:语法检查器会在语法错误的编辑生效前拦截它,直接消除一整类无声的智能体错误。 紧凑反馈:环境响应保持简短且信息丰富,避免上下文过载,维持循环的简洁性。
关键洞察:智能体编程的上限不由模型决定,而取决于它接触代码的接口;设计好ACI,同一模型就能跃上更高台阶。
在SWE-bench上,SWE-agent达到12.5%的pass@1,在HumanEvalFix上达到87.7%,两者均是非交互式语言模型中的最先进水平。
阅读本文,再查看下面的文章。
相似文章
@dair_ai: 关于计算机使用智能体的杰出论文。(收藏)计算机使用智能体通过屏幕操控真实软件,……
PreAct 将成功的智能体运行编译成小型状态机程序,在重复任务上实现 8.5-13 倍更快的重放,无需逐步骤的语言模型调用,并通过运行时屏幕检查确保正确性。
@rohanpaul_ai: 这篇来自Meta、斯坦福和伊利诺伊的调研论文认为,当代码成为AI智能体的主要工作层时,它们的效果更好…
这篇来自Meta、斯坦福和伊利诺伊的调研论文认为,当代码被用作AI智能体的主要工作层时,它们表现更好,将代码视为推理、行动和建模的环境。作者引入了‘智能体框架’的概念,包含工具、内存、沙箱和反馈循环。
@techwith_ram: https://x.com/techwith_ram/status/2064925285003542820
探讨了AI编程中从人类在环到自主代理循环的转变,其中代理自我提示并迭代,讨论了减少人类控制的前景与隐藏成本。
@zostaff: 这篇论文完全改变了我对自我改进智能体的看法:初始化 -> 运行 -> 分析 -> 分支 -> 更新…
这篇论文提出了一种自我改进智能体的新颖蓝图,通过元智能体和反馈智能体结合支架编辑和权重训练,在AlphaFold的CUDA内核上实现了14倍加速。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。