框架还是模型?通过受污染控制的私有测试套件隔离代理编程中的框架效应

arXiv cs.CL 论文

摘要

该研究使用受污染控制的私有基准测试,隔离了代理编程系统中框架与模型的影响,发现供应商原生框架并无一致优势,且在成本和任务性能上存在差异。

arXiv:2609.11987v1 通告类型:跨领域 摘要:代理编程系统将语言模型与框架结合:框架包括工具、提示和控制流,将聊天模型转变为自主软件工程师。供应商提供针对其自身模型调优的框架,从业者假设供应商原生配对能解决更多任务。我们使用一个私有、受污染控制的256个仓库和截止日期后竞赛任务的测试套件,通过配对相同模型的对比来衡量这一假设。相同的80个任务在claude-agent-sdk和deepagents下运行,使用claude-opus-4-8;在openai-codex SDK和deepagents下运行,使用gpt-5.5;并分别使用gemini-3.5-flash和deepseek-v3.2作为旁侧单元。800次计划运行中有792次由隔离的预言机评分。两种对比均未显示出任一框架的平均优势:对于Opus 4.8为-1.25个百分点(48.8% vs 50.0%,任务自举95% CI [-10.0, +7.5]),对于GPT-5.5为+1.25个百分点(55.6% vs 54.4%,CI [-4.4, +6.9])。Opus的平均结合了相反的分层:原生框架在61个仓库任务上落后9.0个百分点,在19个竞赛任务上领先23.7个百分点(标签置换p = 0.003)。该划分是在查看数据后选择的,需要设计复制。正确性和完整性也分开:81次运行中有22次在达到时间上限时已产生了通过的补丁。从原始每轮使用量按冻结列表价格重新定价,中性框架在Opus 4.8上每个解决任务的成本是1.3至1.6倍,在GPT-5.5上是1.2倍。这些是观察使用量估计。在Anthropic账户上,58次运行没有使用记录,将此支出分配到任一单元会使Opus比率在0.7到2.3之间,因此计费顺序未解决。此修订更正了2026年8月的手稿,其成本数据基于我们自身遥测中的使用语义缺陷(第5.1节)。我们发布了协调器、评分预言机、重分析代码和派生汇总。任务保持私有。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:45

# 框架还是模型?在防污染控制私有测试套件中隔离智能编码的框架效应
来源:https://arxiv.org/html/2609.11987

## 框架还是模型?在防污染控制私有测试套件中隔离智能编码的框架效应
**注:** 本修订版于2026年9月8日发布。研究后审查发现成本遥测系统中存在使用语义缺陷。相较于2026年8月的手稿,成本结果、探测解释和注册声明已作修正,能力分析已使用协议测试重新运行。修订说明与重新分析代码包含在复现包中。

**CCS分类:** 软件及其工程 软件验证与确认;CCS分类:计算方法 人工智能
**2026年**

###### 摘要
智能编码系统将语言模型与框架(harness)相结合:框架包括工具、提示词、截断策略和控制流,能将对话模型转化为自主软件工程师。供应商通常会针对自家模型优化框架,从业者普遍认为原生配套组合能解决更多任务。我们通过在256个仓库和截止日期后竞赛任务构成的私有防污染控制套件上进行配对相同模型对比,直接测量了这一假设。相同的80个任务分别在Claude-Opus-4-8模型上使用claude-agent-sdk和deepagents(LangGraph)框架运行,在GPT-5.5模型上使用openai-codex SDK和deepagents框架运行,并以Gemini-3.5-Flash和DeepSeek-V3.2作为对照组。每次运行均在独立KVM微虚拟机中执行,配备仅追加事件记录器,800个计划运行中的792个通过Docker隔离的判定器评分。两种对比均未显示任一框架具有平均优势。Opus 4.8的配对解题率差异为-1.25个百分点(原生框架48.8% vs 中立框架50.0%,任务自举法95%置信区间[-10.0, +7.5]);GPT-5.5为+1.25个百分点(55.6% vs 54.4%,置信区间[-4.4, +6.9]),结果基于选定任务池。Opus的平均值结合了相反趋势:在61个仓库任务中原生框架落后9.0个百分点(置信区间[-17.2, -0.8]),在19个竞赛任务中领先23.7个百分点(置信区间[+2.6, +44.7])。工作负载标签的置换检验显示此交互效应p=0.003。该划分是在查看数据后确定的,故我们将其作为事后模式报告,需通过设计复现进一步验证。正确性与自主完成度也存在分离:81次在时钟上限被取消的运行中,有22次已生成通过测试的补丁。基于原始每轮使用量按冻结标价重新计算后,中立框架在Opus 4.8上每解决任务成本为原生框架的1.3-1.6倍(任务自举区间在不同定价基础上为1.1-2.1),在GPT-5.5上为1.2倍(1.05-1.33)。这些为观测使用量估算。在Anthropic账户中,58次运行未产生使用记录,若将这些未记录支出完全分配至任一单元,会使Opus比率在0.7至2.3间变动,故其账单排序尚未确定。针对单一截断设置的12项任务探测无明确结论。本修订版修正了2026年8月手稿中基于我们自身遥测使用语义缺陷的成本数据,详见§5.1及修订记录。我们公开发布编排器、评分判定器、重新分析代码及衍生聚合数据。任务集保持私有以维护套件有效性。

**关键词:** 智能编码,LLM智能体,智能体框架,基准测试,防污染,成本测量,提示词缓存,预注册

## 1.引言
编码智能体基准测试通常变更模型而固定框架,或将供应商的框架与模型作为一个不透明系统整体报告。这两种设计都无法回答当团队已拥有前沿模型并需选择驱动软件时面临的问题。原生框架将部署绑定到单一供应商。中立框架(如deepagents)承诺跨供应商可移植性,但其能力与成本代价从未在私有工作上被测量。我们通过配对相同模型对比进行测量。固定模型仅变更框架:Claude-Opus-4-8分别在claude-agent-sdk和deepagents下运行(单元C1和C2),GPT-5.5分别在官方openai-codex SDK和deepagents下运行(单元C3和C4)。另有两个对照单元在中立框架上运行Gemini-3.5-Flash和DeepSeek-V3.2。所有六个单元共享统一执行基质:每次运行一个微虚拟机,相同的仓库种子和提示词,共享线协议,以及规范的仅追加事件历史。框架是每次对比中预设的变量。§7列出了剩余的配置差异,如codex单元更小的虚拟机内存。研究于2026年6月规划,2026年8月执行,围绕程序计划在首次评分运行前确定的两个问题展开。研究问题1(RQ1)询问供应商原生框架是否在相同模型上比中立框架具有能力优势。计划中的假设H1至H3涵盖存在性、供应商依赖性和按任务类型集中度。研究问题2(RQ2)询问能力优胜者是否也是每解决任务成本优胜者(H4)。两个方法论问题塑造了此类研究。第一个是污染问题。公共基准测试会泄露到训练语料中,因此我们的套件是私有的:从四个生产代码库(AccessCtl、IdentityApp、FieldSvc、BookingSvc)挖掘的179个仓库任务(含隐藏测试和标准补丁),以及77个在机械推导资格日期后发布的竞赛任务。机器可读的截止日期注册表在数据收集前冻结,运行时漂移门在每次评分阶段前验证服务模型身份。任务集保持私有,我们公开方法论、注册表格式和编排代码。第二个问题是成本测量,本研究在此成为自身案例。智能体评估越来越多地报告基于框架报告的令牌使用量推导的美元成本。我们的遥测标准化器将某一SDK的缓存令牌约定应用于所有三个框架,2026年8月版本的本文基于此建立了成本结论。研究后审查发现了该缺陷(§5.1)。本修订版从原始每轮事件重新推导所有成本数据,并在复现包附带的修订记录中记录了每一项变更声明。

**贡献:**
1. (1) 在私有防污染控制套件上进行的配对相同模型框架对比(每次对比80个任务,792次评分运行),采用任务级自举区间和协议规定的检验报告。
2. (2) 在Opus 4.8上发现事后工作负载模式,框架效应在仓库与竞赛任务间符号相反,通过显式交互零假设检验,并证明其算术结合为总体估计。
3. (3) 区分正确输出与自主完成度两个终点,使用时钟上限、终端状态和延迟分析。
4. (4) 使用语义缺陷及其修正作为方法论结果:输入令牌字段在某些SDK中包含缓存,在其他SDK中排除缓存,假设一种约定的标准化器会使另一种加倍。我们提供可复现的源到记录器对账及账户级账单支出校验。
5. (5) 具有双重实时拦截的运行时模型漂移门,以及发布框架中立编排器、评分判定器、重新分析代码和衍生聚合数据。

## 2.基准测试设计
### 2.1.任务套件
套件包含**256个任务**,分为两个赛道。
**赛道A(179个仓库任务)** 挖掘自我们组织拥有的四个私有生产代码库:AccessCtl(110个任务)、IdentityApp(27个)、FieldSvc(40个)和BookingSvc(2个)。每个任务遵循SWE-bench模式,包含FAIL_TO_PASS和PASS_TO_PASS隐藏测试及标准补丁。
**赛道B(77个竞赛任务)** 包含严格在资格日期后发布的LeetCode周赛和AtCoder题目,每个任务附有隐藏测试套件(总计2.0 GB)。任务提示词在文档化的作者和审稿人协议下最终确定。142个挖掘提示词被重写,37个手动创作,所有179个赛道A提示词均按AI作者、AI审稿人和人工抽查审核的“审稿人最终版-v1(无剧透)”标准进行评审。179个中有51个需要修改。套件的一个属性已知但无法从存档测量:约30个赛道A任务通过精确名称导入内部符号(称为白盒耦合),这独立于内在难度降低了题解率。任务标签未保留,因此计划的敏感性分析无法运行,且我们无法判断该耦合是否偏袒某一框架(§7)。每个评分环境都是基于清单的Docker,当代码库需要时配备服务边车(AccessCtl用PostgreSQL,FieldSvc用MSSQL,BookingSvc用模拟OIDC服务)。每个环境在首次评分运行前经过验证:标准补丁必须通过,基础树必须失败,通过判定器不变性强制执行确定性。此预检在资格测试期间发现并修正了一个有缺陷的标准补丁。

### 2.2.防污染协议
套件在构造上是私有且截止日期后的,包含四层防御:
**冻结截止日期注册表与资格算术。** 我们于2026年6月24日(在任何评分运行前)冻结了模型训练截止日期的机器可读注册表(eval/plans/cutoffs.frozen.md + .json)。资格日期**2026-03-02**是研究模型(Opus 4.8,2026-01-31)最新约束截止日期加30天缓冲期。所有赛道B题目均晚于此日期,赛道A镜像遵循基础祖先泄露规则。注册表还记录了相似性风险。例如,gemini-3.5-flash-lite的截止日期为2026年3月,晚于我们的资格日期,因此静默模型替换会使控制失效。
**运行时漂移门。** 每次运行环节以预检门(eval/orchestrator/preflight.py)开始,验证服务模型标识符(含日期快照标准化),并软检查模型自报截止日期。它正确标准化了OpenAI服务的gpt-5.5-2026-04-23(对应固定的gpt-5.5),并观察到DeepSeek自报截止日期在探测间变化(2023-07、2023-10、2024-07),因此自报仅供参考。在一次事件中,门探测OpenRouter默认路由而研究运行在DeepInfra固定路由上后,探测被修正为测试运行的确切固定后端(A7)。
**金丝雀、镜像卫生及声明范围。** 金丝雀字符串嵌入私有任务内容中。挖掘仓库从未推送,面向智能体的运行镜像为私有,标准补丁、隐藏测试和金丝雀从未进入镜像。镜像在研究后删除(§7)。注册表和漂移门排除了对竞赛题目的已知训练暴露,仓库任务在构造上是私有的。它们不排除截止日期注册表无法看到的渠道暴露,且我们未在研究模型上运行金丝雀发射探测。因此,声明范围受限于已知截止日期和私有来源所能证明的范围。

### 2.3.实验矩阵、协议存档与修正
**6单元矩阵** 交叉三个框架与四个模型:
**表1.** 单元C1对比C2、C3对比C4固定模型仅变更框架(RQ1)。C6的OpenRouter后端固定为DeepInfra且禁止回退,以确保可复现评估在每次运行中不接收不同的服务量化。库版本为存档中每个会话行记录的版本。

**解题指标与结果分类。** 每次运行的补丁在宿主机侧提取(git diff),由Docker判定器离线评分,裁决为{pass, fail, timeout, apply_error}。任务解题率为重复的平均值,单元解题率为任务的平均值。运行结果为{completed, ceiling_wallclock, agent_error, infra}。基础设施行从不评分,最多重试两次。时钟上限(1,200秒)取消智能体,判定器随后对取消时的现有补丁评分。因此上限运行可能通过(§4.4)。重复是同一提示词的独立重运行,因为框架不暴露采样种子。

**阶段与池冻结。** 研究分四个阶段进行:彩排覆盖14个任务×6个单元;筛选运行在C1和C3上以k=1运行所有256个任务(512/512键评分,C1 54.3%,C3 58.2%,91%的任务一致);确定性池冻结后,主运行覆盖冻结池。选择规则是机械的:所有24个C1与C3在筛选中不一致的任务构成分歧带。剩余名额从均通过和均失败池中交替填充,按sha256(task_id)排序,目标80个(28+28)。冻结池(竞赛19个,AccessCtl 36个,IdentityApp 13个,FieldSvc 12个)由哈希锁定(final-80.lock.json, sha256 99cf4e42...c575c)。C1–C4重复2次,C5和C6重复1次,共800个主运行键。

**选择规则对估计量的影响。** 不一致任务占筛选池的9.4%(256个中24个),占主池的30%(80个中24个)。因此所有主运行平均值都基于对两个供应商原生捆绑包不一致任务过采样的池。该池不是套件的随机样本,§4.2的筛选混合敏感性分析重用选择数据而非复现它。

**计划功效。** 程序计划声明设计可检测约8-10个百分点的平均溢价,更小则不行。修正案A3将核心单元从三次重复减至两次,将计划最小可检测效应移至约12个百分点。这些是在计划假设下的规划量。观测不确定性是§4中与每个估计一起报告的任务自举区间。

**协议存档。** 2026年8月手稿称设计在OSF预注册。记录较弱,我们精确说明:包含假设H1至H4、单元设计和统计计划(McNemar与聚类自举区间、用于原生性×供应商交互的混合效应逻辑模型、BH-FDR、pass@k及上述功效声明)的程序计划首次提交至项目仓库于2026年6月11日(在任何评分运行前)。它通过版本控制而非注册表定日期。一个私有OSF项目保存了2026年6月25-28日存入的时间戳设计文档:决策规则、截止日期注册表、金丝雀和许可证说明,以及一个PREREGISTRATION.md(6月28日),描述了四模型基准对比而非框架对比。未创建OSF注册,项目为私有。其文件列表(https://osf.io/enjha/?view_only=40f7fc5fdd0043e0ad052b1d3017b209)显示了存入文件及其服务器日期。**表2**(https://arxiv.org/html/2609.11987#S2.T2)将计划映射至执行情况。

**表2.** 从协议到执行

**修正案。** 当运营现实迫使改变时,我们在受影响数据收集前修正并记录每次修正:A1将C1预算上限从4美元提高至8美元(上限在彩排中受限于FieldSvc);A2重新校准筛选止损线;A3将C2/C4重复从3次减至2次;A4将池从120减至80个任务并保留规则;A5在内存溢出运行者死亡后为deepagent单元及后续C1提供8 GB沙箱;A6提高完成阶段的运营主止损线;A7将漂移探测固定至运行后端。这些均未触及评分规则、池规则或配对设计。

## 3.系统与执行
### 3.1.作为

相似文章

同一模型,不同运行框架:编码智能体的差异化表现

arXiv cs.AI

本研究探讨了在模型固定不变的情况下,改变编码智能体中的运行框架配置如何影响其在代码基准测试上的表现。研究结果表明,一种能自动缩短早期工具输出以管理上下文的“优化框架”,可提升任务完成率,尤其在上下文长度受限的场景下效果显著。