编码代理工具架设计的实证研究
摘要
本文实证研究了编码代理的工具架设计,评估了规划和上下文管理等组件,以提高软件工程任务的性能。
查看缓存全文
缓存时间: 2026/09/18 03:02
论文页面 - 编码代理测试框架设计的实证研究
来源:https://huggingface.co/papers/2609.20804
摘要
编码测试框架决定了自主编码代理如何将模型能力转化为长期软件工程性能,然而现有研究通常将测试框架视为整体系统进行评估,导致各组件的有效性不明确。为支持组件级对比,本研究采用一个轻量级编码测试框架进行分析,该框架固定执行循环但变化三个核心组件:规划、动作空间与上下文管理。通过在SWE-Bench Verified和Terminal-Bench 2.1上评估四种模型,我们共测试了176组匹配配置,涵盖五种上下文管理策略、四种上下文窗口预算以及针对规划和动作空间的消融实验。研究发现:
(1) 随着上下文窗口预算收紧,上下文管理的价值日益凸显,其主要益处来自避免上下文溢出故障。
(2) 在上下文管理策略中,基于规则的精简与基于大语言模型的摘要分阶段结合提供了最佳整体效率,而使精简内容可恢复的机制虽增加复杂性,但模型极少使用且无法提升准确率。
(3) 规划的作用从为弱模型提供准确率支撑转变为强模型的成本优化手段,且对准确率影响甚微。
(4) 预定义工具能提升较弱bash技能模型的性能,而具备bash能力的模型可有效使用纯bash接口,实现显著更低的成本,尤其在命令行密集型任务中表现突出。轨迹级分析解释了这些效应:上下文管理延长了执行轨迹而未显著改变代理行为,规划改变了轨迹的终止点,动作空间则调整了代码编写的粒度。这些发现为模型与预算感知的测试框架设计提供了指导,并提出了评估未来测试框架组件的模块化框架。
查看arXiv页面 (https://arxiv.org/abs/2609.20804) 查看PDF (https://arxiv.org/pdf/2609.20804) 添加至收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.20804)
在您的代理中获取本文:
hf papers read 2609\.20804
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型关联本文
在模型README.md中引用arxiv.org/abs/2609.20804以从本页面关联。
引用本文的数据集 0
无数据集关联本文
在数据集README.md中引用arxiv.org/abs/2609.20804以从本页面关联。
引用本文的空间 0
无空间关联本文
在空间README.md中引用arxiv.org/abs/2609.20804以从本页面关联。
包含本文的收藏集 0
无收藏集包含本文
将本文添加至收藏集 (https://huggingface.co/new-collection)以从本页面关联。
相似文章
框架探讨:框架对编码智能体的影响有多大?
本文探讨了框架对编码智能体的影响,分析了不同的框架设置如何影响其在编码任务中的性能和结果。
同一模型,不同运行框架:编码智能体的差异化表现
本研究探讨了在模型固定不变的情况下,改变编码智能体中的运行框架配置如何影响其在代码基准测试上的表现。研究结果表明,一种能自动缩短早期工具输出以管理上下文的“优化框架”,可提升任务完成率,尤其在上下文长度受限的场景下效果显著。
@dair_ai: 来自 Zoom 和同事的非常有趣的工作。如果您维护一个手工构建的编码框架,这里有一些很棒的见解……
本文总结了针对编码代理的框架设计的实证研究,表明上下文管理可防止溢出故障、在 LLM 摘要之前进行基于规则的省略具有成本效益,并且规划的作用随模型强度而变化。
代码即代理框架
本综述论文提出了一个统一视角,将代码视为代理系统中代理推理与执行的操作基础,围绕三个层次组织讨论:框架接口、机制与扩展。
面向长时应用开发的Harness设计
Anthropic工程师详细介绍了一种多智能体Harness设计,利用生成器与评估器智能体提升Claude在长时间内自主构建完整、高质量前端应用的能力。