停止在不公开执行框架的情况下比较LLM智能体
摘要
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。
arXiv:2605.23950v1 公告类型: 新论文
摘要:这篇立场论文认为,对于在具有相当前沿能力的不同模型上进行评估的长期任务,智能体执行框架(即围绕语言模型控制上下文构建、工具交互、编排和验证的基础设施层)通常是比其封装的模型更强的智能体性能决定因素。我们形式化并辩护了绑定约束论:在该机制下,性能方差更多由框架配置而非模型选择决定,因此当前的评估协议系统地错误地将框架层面的提升归因于模型改进。我们从三个方面支持这一论点。首先,控制理论形式化将框架视为闭环动态系统的控制器,而LLM是其控制的随机策略,这解释了为什么小的框架变化可能产生超过替换模型所带来的性能变化。其次,已发表的基准测试、行业部署以及受控方差分解表明,框架引起的方差可能显著超过模型引起的方差,包括模型排名逆转的情况。第三,我们提出了一种框架感知的评估框架,包含披露标准和方差分解协议。在框架规格被披露之前,长期跨度智能体的排行榜比较应被视为不完整且可能具有误导性。
查看缓存全文
缓存时间: 2026/05/26 09:02
# 不在披露执行框架的情况下,请停止比较 LLM 智能体 来源:https://arxiv.org/html/2605.23950 张云贝¹ 王珍妮特¹ 葛英强² 徐伟杰³ Hamm Jihun¹ Reddy Chandan K.⁴ ¹杜兰大学 ²罗格斯大学 ³独立研究者 ⁴弗吉尼亚理工大学 [email protected] [email protected] ###### 摘要 本立场论文认为,对于在能力相当的前沿模型之间进行评估的长周期任务,智能体执行框架(即围绕语言模型管理上下文构建、工具交互、编排和验证的基础设施层)往往是决定智能体性能的更强因素,其影响力甚至超过其所包裹的模型本身。我们形式化并论证了**绑定约束论**:在该范式下,性能方差主要由框架配置而非模型选择决定,因此当前的评估协议系统性地将框架层面的增益误归因于模型改进。我们从三个维度支撑这一论点。首先,通过控制论形式化,将框架视为闭环动态系统的控制器,而 LLM 则为其所管理的随机策略,这解释了为何微小的框架变更可以产生超过替换模型本身的性能变化。其次,已发表的基准测试、工业部署实例以及受控方差分解均表明,框架引起的方差可能显著超过模型引起的方差,甚至出现模型排名逆转的情况。第三,我们提出一个框架感知的评估体系,包含披露标准和方差分解协议。在框架规格被披露之前,针对长周期智能体的排行榜比较应被视为不完整且可能具有误导性。 ## 1 引言 LLM 智能体评估的标准实践是报告每个 {模型, 基准} 对的单一数值,并将其归因于模型。诸如 SWE-bench [13 (https://arxiv.org/html/2605.23950#bib.bib3)]、Terminal-Bench [21 (https://arxiv.org/html/2605.23950#bib.bib16)]、AgentBench [18 (https://arxiv.org/html/2605.23950#bib.bib4)] 和 GAIA [22 (https://arxiv.org/html/2605.23950#bib.bib43)] 等排行榜都将智能体性能视为模型本身的属性,这种惯例将研究方向引向模型扩展、针对工具使用的微调以及提示层面的技术。其隐含假设是,智能体能力主要由模型能力驱动,且一个足够强大的模型能在长周期任务上产生可靠的行为。 这一假设忽略了**执行框架**:位于模型与任务之间的软件层,它构建模型所看到的上下文,中介其工具调用,验证其输出,并决定何时重试、升级或停止。每个基准分数都是由模型和框架共同产生的,但框架很少被披露,也几乎从未在比较中保持恒定。这种现象并非孤例:保持模型不变,仅改变框架,即可将 Terminal-Bench 2 的 pass@1 从 69.7% 提升至 77.0% [17 (https://arxiv.org/html/2605.23950#bib.bib2)],而独立的第三方基准监控报告在 SWE-bench Verified 上存在高达 15 个百分点的纯支架变动 [4 (https://arxiv.org/html/2605.23950#bib.bib48)]。在此类长周期任务上,同一模型在不同框架下可能排名于竞争对手之上或之下。 我们主张,除非披露执行框架,否则 LLM 智能体在长周期任务上的基准分数对于跨模型比较是无效的。有效的比较需要采用**锁定框架协议**(即对所有模型应用单一的指定框架),或采用**因子化协议**(即将框架选择作为受控因素变化,并报告方差分量)。此披露要求延伸至负责上下文构建、工具调用中介和输出验证的基础设施层。若无此类披露,排行榜衡量的是模型与框架的混合体,由此得出的结论被系统性地误归因于模型。 实际后果是具体的。跨论文的模型比较不可靠,因为两个报告的分数通常反映不同的框架。缺少完整的框架规格说明,复现已发表的分数是困难的,因为框架对结果的重要性可能不亚于模型本身。研究激励也被扭曲:投资瞄准模型层面的改进,而框架变更——长周期任务上性能方差的主要来源——却获得了不成比例的关注。更好的模型仍然重要,框架工程也是已部署智能体的一部分。本立场呼吁建立一个归因框架,以决定一个观察到的基准增益应归功于模型、框架,还是两者的交互。除了学术准确性之外,这些误归因还影响着该领域目前正在大规模做出的决策,包括资助哪些模型、扩展哪些研究方向、部署哪些智能体。一个无法区分模型与框架的评估体制,会将这些决策引向错误的杠杆。 参照图注 图 1:从推理到控制。推理框架(左)将智能体视为一个处于 while 循环中的模型,将性能归因于 πθ。闭环框架(右)将框架视为控制器 CH:稳定性 V(st)、上下文漂移 δt 和控制延迟 τ 是控制器的属性,模型是开环的,而框架则闭合了回路。 ## 2 为何当前评估混淆了模型与框架 ### 2.1 框架如何进入每个基准分数 标准的智能体评估会使用任务描述、系统提示、工具目录和先前的轨迹状态 [43 (https://arxiv.org/html/2605.23950#bib.bib29),41 (https://arxiv.org/html/2605.23950#bib.bib27),39 (https://arxiv.org/html/2605.23950#bib.bib25)] 组装而成的提示来查询模型,解析令牌级别的输出作为最终答案、工具调用或格式错误的字符串,然后路由工具调用、处理错误、随轨迹增长压缩上下文,并在若干步后停止。此流程中的每个步骤(上下文构建、工具调用、解析、重试、摘要和停止)都是框架决策 [17 (https://arxiv.org/html/2605.23950#bib.bib2),15 (https://arxiv.org/html/2605.23950#bib.bib1),19 (https://arxiv.org/html/2605.23950#bib.bib15),45 (https://arxiv.org/html/2605.23950#bib.bib30)]。因此,单个基准分数是这些选择与针对它们生成输出的模型的联合结果,但已发表的数字记录了模型而忽略了其余部分。 这种混淆并非假设性的。在 SWE-bench Pro 上使用标准化的 SEAL 支架时,Claude Opus 4.5 达到 45.9%,而在 Claude Code 下,同一模型达到 55.4%。在完全相同的底层基础设施上添加单个搜索子智能体(WarpGrep),翻转了 MiniMax 2.5 与 Claude Opus 4.6 在 SWE-bench Pro 上的排名,尽管 Claude Opus 在大多数其他基准上排名更高 [25 (https://arxiv.org/html/2605.23950#bib.bib35)]。整体智能体排行榜(HAL)报告了同一模型在不同支架下在 SWE-bench Verified Mini 上出现两位数的差距,其中报告的单一模型波动对于领先前沿模型高达近 48 个百分点 [14 (https://arxiv.org/html/2605.23950#bib.bib42)]。独立的第三方基准监控报告在 SWE-bench Verified 上,GPT-5 存在高达 11 个百分点的纯支架变动,Kimi K2 Thinking 存在 15 个百分点的变动 [4 (https://arxiv.org/html/2605.23950#bib.bib48)]。这些都不是模型升级带来的效果。它们是框架替换,并且它们通常远超论文报告为有意义的模型进展的那 2 到 4 个百分点的变化。由此产生的归因差距之所以重要,是因为同一个复合数字正以三种互不兼容的方式被解读:在跨论文的模型比较中作为模型属性,在跟踪领域进展中作为基准属性,在部署决策中作为智能体属性。然而,只有第三种解读是定义明确的。前两种需要当前报告机制无法提供的解耦。 ### 2.2 结构性原因:智能体是闭环系统 这种混淆反映了智能体工作方式的一个结构性事实。智能体执行是一个离散时间的闭环动态过程。设 st 表示智能体在步骤 t 的状态,包含完整的上下文窗口和任何持久化记忆。模型充当一个随机策略 at ∼ πθ(·|c(st)),其中 c 是由框架实现的上下文构建函数。框架实现了一个控制器 C,该控制器根据 (st, at, ot) 更新状态到 st+1,其中 ot 是环境观测,在整合到状态之前经过过滤和验证。不同的框架配置 H 在同一模型 πθ 上诱导出不同的控制器 CH。在此模型中,LLM 是开环的。它无法直接访问 st,只能访问 c(st)——框架选择暴露的状态在上下文中的投影。它在步骤之间没有保留任何记忆,除非 CH 注入到 c(st+1) 中。它没有自我修正的机制,除非通过 CH 从 ot 构建的反馈路径。适应、错误恢复和长周期连贯性都是 CH 的属性,而非 πθ 的属性。这一观点延续了将推理、动作和接口视为耦合的智能体研究路线 [43 (https://arxiv.org/html/2605.23950#bib.bib29),16 (https://arxiv.org/html/2605.23950#bib.bib14),28 (https://arxiv.org/html/2605.23950#bib.bib20),5 (https://arxiv.org/html/2605.23950#bib.bib23),40 (https://arxiv.org/html/2605.23950#bib.bib26)]。 这种不对称性是混淆的结构性原因。在闭环系统中,控制器(而非开环策略)管理着决定长周期可靠性的三个量。**稳定性**是指目标预期进展在控制器的更新规则下是否非递减。**上下文漂移**是指任务相关信息离开上下文窗口的速度。**控制延迟**是指从检测到异常到纠正信号到达策略之间的步数。这三个量均非模型属性。一个更强大的模型可以降低异常出现的基准速率,但对异常一旦出现的响应是 CH 的属性,不会随着模型升级而改善 [34 (https://arxiv.org/html/2605.23950#bib.bib45)]。 这一教训比智能体更广泛。开环系统不会通过更大的执行器变得可靠。它们通过反馈控制变得可靠。同样的结构性事实也适用于长周期任务上的 LLM 智能体。图 1 (https://arxiv.org/html/2605.23950#S1.F1) 展示了这种对比:在推理框架下,模型独自承担可靠性负担,而在闭环框架下,框架控制器包围着策略,并提供长周期执行所需的反馈。 ### 2.3 为何标准回应都不够充分 如果混淆是结构性的,问题就在于如何应对。该领域已收敛于四类回应。每一类都解决了部分问题,但没有一个能解决归因问题。 **标准化到单一框架**。在所有提交中锁定框架是最直接的回应,由 HAL 在九个基准上实施 [14 (https://arxiv.org/html/2605.23950#bib.bib42)],由 SWE-bench Pro 的统一支架 [8 (https://arxiv.org/html/2605.23950#bib.bib9),25 (https://arxiv.org/html/2605.23950#bib.bib35)] 实施,也由 Epoch AI 的 mini-SWE-agent 推荐 [4 (https://arxiv.org/html/2605.23950#bib.bib48)] 实施。我们支持锁定框架协议作为两种有效评估体制之一(第 3 节 (https://arxiv.org/html/2605.23950#S3) 给出了另一种),但任何标准化的框架都嵌入了与模型属性相互作用的设计选择,并且排除了当前证据显示很大的框架侧增益。本立场呼吁披露所使用的框架,而非所有评估的统一性。 **扩展模型**。第二种回应认为,更强大的模型将能够管理自己的控制器。经验趋势则相反:Claude Code 在能力增长时重新设计而非移除框架组件 [33 (https://arxiv.org/html/2605.23950#bib.bib41)],托管智能体架构明确地将模型与框架解耦,因为框架假设比模型改进更快过时 [20 (https://arxiv.org/html/2605.23950#bib.bib40)],而 AHE 在前沿基础模型之上产生两位数的通过率提升 [17 (https://arxiv.org/html/2605.23950#bib.bib2)]。没有模型升级能够补偿控制器中反馈结构的缺失(第 2.2 节 (https://arxiv.org/html/2605.23950#S2.SS2))。 **增加更多基准**。第三种回应是,只要有足够多的独立基准,框架引起的噪声就会平均化。最近的增补涵盖了自由职业软件工作、机器学习工程、抗污染编码、代码合成、视觉前端问题和专业服务 [23 (https://arxiv.org/html/2605.23950#bib.bib17),6 (https://arxiv.org/html/2605.23950#bib.bib7),12 (https://arxiv.org/html/2605.23950#bib.bib13),46 (https://arxiv.org/html/2605.23950#bib.bib31),42 (https://arxiv.org/html/2605.23950#bib.bib28),38 (https://arxiv.org/html/2605.23950#bib.bib39)]。这一赌注失败了:每个基准都使用自己的未披露框架,且框架贡献并非零均值,因此增加基准只是增加了独立的 {模型, 框架} 抽样,而没有解决其中任何一个基准内的归因问题。APEX-Agents 发现了与赌注要求相反的情况:智能体失败主要是执行和编排问题,而非知识缺失 [38 (https://arxiv.org/html/2605.23950#bib.bib39)]。 **优化框架**。第四种回应是,该领域已经直接解决了框架质量问题。ADAS 搜索智能体系统 [11 (https://arxiv.org/html/2605.23950#bib.bib12)],Meta-Harness 和 AutoHarness 通过外部循环搜索优化框架代码 [15 (https://arxiv.org/html/2605.23950#bib.bib1),19 (https://arxiv.org/html/2605.23950#bib.bib15)],AHE 通过跨家族迁移演化编码智能体框架 [17 (https://arxiv.org/html/2605.23950#bib.bib2)]。Agentic Context Engineering 将上下文构建优化为一个独立界面 [45 (https://arxiv.org/html/2605.23950#bib.bib30)],而从业者部署报告得出了相同的结论 [30 (https://arxiv.org/html/2605.23950#bib.bib21),47 (https://arxiv.org/html/2605.23950#bib.bib32)]。这些贡献记录了本论文所分析的现象,但回答的是一个不同的问题:如何使框架变得更好,而非如何归因观察到的增益。有些贡献在其自有框架下报告结果,加剧而非解决了归因问题。框架优化是支持本立场的证据基础的一部分,而非其替代品。 结构性问题需要结构性解决方案:披露。用于产生基准分数的框架必须是实验条件的一部分,而跨模型比较必须固定框架(锁定框架协议)或将其作为受控因素变化(因子化协议)。 ## 3 绑定约束论 **绑定约束论**:对于在能力相当的前沿模型上运行长周期任务的 LLM 智能体,性能方差主要由框架配置而非模型选择决定,因此当前的评估协议系统性地将框架层面的增益
相似文章
不是能力问题:LLM智能体层级间的控制敏感度是非单调的
本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。
面向执行轨迹的推理时对齐框架
本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。
最好的智能代理工具会这样做……
作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。