编码代理工具架设计的实证研究

Hugging Face Daily Papers 论文

摘要

本文实证研究了编码代理的工具架设计,评估了规划和上下文管理等组件,以提高软件工程任务的性能。

编码工具架决定了自主编码代理如何将模型能力转化为长期的软件工程性能,然而现有工作通常将工具架视为整体系统进行评估,使得各组件的有效性不明确。为了实现组件级比较,我们使用一个轻量级的编码工具架来研究这个问题,该工具架的执行循环固定,同时改变三个组件:规划、动作空间和上下文管理。在四个模型上进行评估,这些模型在 SWE-Bench Verified 和 Terminal-Bench 2.1 上测试,我们评估了 176 个匹配设置,涵盖五种上下文管理策略、四种上下文窗口预算以及规划和动作空间的针对性消融。我们发现:(1) 随着上下文窗口预算收紧,上下文管理变得越来越有价值,其大部分益处来自防止上下文溢出故障。(2) 在基于 LLM 的摘要之前设置基于规则的省略,在上下文管理策略中提供了最强的整体效率,而使省略内容可恢复会增加模型很少使用的机制,并且不会带来准确性提升。(3) 规划从对较弱模型的准确性支架转变为对较强模型的成本节省者,准确性几乎没有变化。(4) 预定义工具提高了 bash 能力较弱的模型的性能,而 bash 能力强的模型可以使用仅 bash 的界面有效运行,并显著降低成本,尤其是在以命令行为中心的任务上。轨迹级分析解释了这些效果:上下文管理扩展了执行轨迹而不显著改变代理行为,规划改变了轨迹停止的位置,动作空间改变了代码编写的粒度。这些发现为模型和预算感知的工具架设计提供了信息,并为评估未来的工具架组件提供了模块化框架。
查看原文
查看缓存全文

缓存时间: 2026/09/18 03:02

论文页面 - 编码代理测试框架设计的实证研究

来源:https://huggingface.co/papers/2609.20804

摘要

编码测试框架决定了自主编码代理如何将模型能力转化为长期软件工程性能,然而现有研究通常将测试框架视为整体系统进行评估,导致各组件的有效性不明确。为支持组件级对比,本研究采用一个轻量级编码测试框架进行分析,该框架固定执行循环但变化三个核心组件:规划、动作空间与上下文管理。通过在SWE-Bench Verified和Terminal-Bench 2.1上评估四种模型,我们共测试了176组匹配配置,涵盖五种上下文管理策略、四种上下文窗口预算以及针对规划和动作空间的消融实验。研究发现:
(1) 随着上下文窗口预算收紧,上下文管理的价值日益凸显,其主要益处来自避免上下文溢出故障。
(2) 在上下文管理策略中,基于规则的精简与基于大语言模型的摘要分阶段结合提供了最佳整体效率,而使精简内容可恢复的机制虽增加复杂性,但模型极少使用且无法提升准确率。
(3) 规划的作用从为弱模型提供准确率支撑转变为强模型的成本优化手段,且对准确率影响甚微。
(4) 预定义工具能提升较弱bash技能模型的性能,而具备bash能力的模型可有效使用纯bash接口,实现显著更低的成本,尤其在命令行密集型任务中表现突出。轨迹级分析解释了这些效应:上下文管理延长了执行轨迹而未显著改变代理行为,规划改变了轨迹的终止点,动作空间则调整了代码编写的粒度。这些发现为模型与预算感知的测试框架设计提供了指导,并提出了评估未来测试框架组件的模块化框架。

查看arXiv页面 (https://arxiv.org/abs/2609.20804) 查看PDF (https://arxiv.org/pdf/2609.20804) 添加至收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.20804)

在您的代理中获取本文:

hf papers read 2609\.20804

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型关联本文
在模型README.md中引用arxiv.org/abs/2609.20804以从本页面关联。

引用本文的数据集 0

无数据集关联本文
在数据集README.md中引用arxiv.org/abs/2609.20804以从本页面关联。

引用本文的空间 0

无空间关联本文
在空间README.md中引用arxiv.org/abs/2609.20804以从本页面关联。

包含本文的收藏集 0

无收藏集包含本文
将本文添加至收藏集 (https://huggingface.co/new-collection)以从本页面关联。

相似文章

同一模型,不同运行框架:编码智能体的差异化表现

arXiv cs.AI

本研究探讨了在模型固定不变的情况下,改变编码智能体中的运行框架配置如何影响其在代码基准测试上的表现。研究结果表明,一种能自动缩短早期工具输出以管理上下文的“优化框架”,可提升任务完成率,尤其在上下文长度受限的场景下效果显著。

代码即代理框架

Hugging Face Daily Papers

本综述论文提出了一个统一视角,将代码视为代理系统中代理推理与执行的操作基础,围绕三个层次组织讨论:框架接口、机制与扩展。

面向长时应用开发的Harness设计

Anthropic Engineering

Anthropic工程师详细介绍了一种多智能体Harness设计,利用生成器与评估器智能体提升Claude在长时间内自主构建完整、高质量前端应用的能力。