@h100envy: 这篇论文彻底改变了我对自主工程智能体的看法:给智能体一个界面,而不是bash -> ...

X AI KOLs Timeline 论文

摘要

本文介绍了针对自主编码智能体的智能体-计算机接口(ACI),用专为导航、编辑和反馈设计的命令取代原始bash,在SWE-bench和HumanEvalFix上取得了最先进的结果。

这篇论文彻底改变了我对自主工程智能体的看法: 给智能体一个界面,而不是bash -> 导航代码仓库 -> 通过智能体命令编辑文件 -> 运行测试 -> 将环境反馈反馈回循环 以下是5步蓝图: ACI:智能体获得的不是原始终端,而是一个专为满足其需求而构建的智能体-计算机接口,就像人类拥有IDE一样。 导航:文件和仓库范围的搜索命令取代了盲目的grep,这样智能体无需漫无目的就能找到正确的位置。 编辑:文件编辑通过具有有限窗口的智能体命令进行,而不是转储整个文件。 护栏:在应用编辑之前,linter会阻止语法错误的编辑,从而消除一整类无声的智能体错误。 紧凑反馈:环境响应保持简短且信息丰富,这样上下文就不会被淹没,循环保持干净。 关键洞察:自主编码的上限不是由模型设定的,而是由它接触代码的接口设定的;设计好ACI,同一个模型就能跳得更高。 在SWE-bench上,SWE-agent达到了12.5%的pass@1,在HumanEvalFix上达到了87.7%,两者都是针对非交互式LM的最先进结果。 阅读此文,然后查看下面的文章。
查看原文
查看缓存全文

缓存时间: 2026/07/11 21:29

这篇论文彻底改变了我对自主工程智能体的认知:

给智能体一个接口,而非bash终端 → 浏览仓库 → 通过智能体命令编辑文件 → 运行测试 → 将环境反馈重新注入循环

以下是5步蓝图:

ACI(智能体-计算机接口):智能体获得的不是原始终端,而是一个按需定制的智能体-计算机接口,配备适合其需求的命令,就像人类获得IDE一样。

导航:用文件与仓库级搜索命令替代盲目的grep,让智能体准确找到目标位置,无需四处游荡。

编辑:文件编辑通过智能体命令完成,使用有边界的窗口,而非倾倒整个文件。 护栏:语法检查器会在语法错误的编辑生效前拦截它,直接消除一整类无声的智能体错误。 紧凑反馈:环境响应保持简短且信息丰富,避免上下文过载,维持循环的简洁性。

关键洞察:智能体编程的上限不由模型决定,而取决于它接触代码的接口;设计好ACI,同一模型就能跃上更高台阶。

在SWE-bench上,SWE-agent达到12.5%的pass@1,在HumanEvalFix上达到87.7%,两者均是非交互式语言模型中的最先进水平。

阅读本文,再查看下面的文章。

相似文章

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。