@joelniklaus: Codex 对大型模型过度优化:在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9!几乎……
摘要
一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。
查看缓存全文
缓存时间: 2026/08/08 07:01
Codex 为大型模型做了过度优化:它在 GLM 5.2 的 10 个 harness 中排名第 2,但在 Gemma-4 上却跌至第 9!
这个领域里几乎所有的精力都花在了调整模型权重上。我们想知道,最终的分数在多大程度上是由包裹在模型外面的 harness 决定的,而不是由权重决定的。于是我们在 SWE-bench Pro 上用两个模型跑了 10 个编码智能体 harness。
事实证明,影响很大。更换 harness 后,GLM-5.2 上的 pass@1 从 23% 上升到 52%,Gemma 4 26B-A4B 上则从 15% 上升到 36%——这个差距比大多数模型版本更新带来的提升还要大。
而且排名并不转移。两个模型的 harness 排行榜之间的秩相关系数是 -0.05,也就是说:完全没有相关性。
Codex 并不孤单。所有由模型厂商随模型发布的 harness,在小模型上排名都会下降——Codex 从第 2 跌到第 9,Claude Code 从第 3 跌到第 7,Qwen Code 从第 4 跌到第 6——而与模型无关的 harness 则排名上升:crush 从第 7 升到第 1,opencode 从第 8 升到第 2,pi 从第 9 升到第 4。
最典型的例子是 crush:它在 GLM-5.2 上排第 7,在 Gemma 4 上排第 1。对两者运行完全相同的脚手架,小模型以 4 个百分点的优势胜出,价格却只有后者的十二分之一:每个任务 $0.30 对 $3.61。
Gemma 4 的最佳 harness 击败了 GLM-5.2 的四个最差 harness。一个 26B 的模型配上合适的脚手架,和一个 744B 的模型配上不合适的脚手架,相差并不大。
每个已解决任务的平均成本:Gemma 4 + crush 为 $0.84(通过率 36%)。GLM-5.2 上能达到同等分数的最便宜配置是 openclaw,通过率 38%,成本 $7.05。
各 harness 在每个任务上的输出 token 数从 16k 到 621k 不等:你支付的费用相差 39 倍,但得到的回报只相差 2 倍。
输入 token 中有 97% 是重复发送的对话前缀,因此提示词缓存(prompt caching)非常重要。
实验设置:每个 harness 都在同样的 250 个 SWE-bench Pro 任务上对两个模型各运行一次,每个任务各 rollout 一次,并按各 harness 实际消耗的 token 以 API 列表价格计费。在图中,深色圆圈表示该组合位于两个模型共同构成的 Pareto 前沿上;淡色圆点表示你可以在别处用更少的钱获得更高分数。为了图示清晰,10 个 harness 中有 2 个(goose 和 hermes)未在图中显示。
相似文章
观察:每个模型的最佳代理框架将由模型开发者自身提供
讨论人工智能模型如何在使用其自身开发者构建的框架时表现最佳,而第三方框架可能导致表现不佳,尽管基准测试成绩出色。文中引用了Claude Code(针对Claude模型)和Codex(针对GPT模型)等示例。
@omarsar0: // 适配接口,而非模型 // 我对我的廉价模型加优质harness构建的结果感到着迷…
提出了Life-Harness,一种通过适配运行时接口而非模型权重来改进冻结的LLM智能体的方法,在126个设置和18个backbones中实现了平均88.5%的相对改进。
@alighodsi: 在拥有1.1万名员工的情况下,我们的AI成本正在上升。我们应该使用哪种模型和框架来降低成本,同时保持卓越的质量……
Databricks发布了一项内部基准测试,在数百万行代码的代码库上评估编码代理,结果显示框架选择可加倍节省成本,并且像GLM 5.2这样的开源模型在最高难度级别上表现具有竞争力。
@sydneyrunkle: 假设智能体 = 模型 + 工具套件。不幸的是,好的模型越来越贵!所以你需要一个出色的工具套件来…
关于通过改进工具套件组件来优化AI智能体性能的指南,以补偿昂贵的模型成本,重点关注爬山技术。
@browser_use: 开源权重模型已正式追赶上。我们在BrowserCode中测试了GLM 5.2,得分接近Opus级别,且是迄今为止最便宜的模型……
开源权重模型已追赶上专有模型,GLM 5.2在浏览器代理任务中以低成本实现了接近Opus级别的得分。其他模型如Minimax M3和Kimi k2.7也显示出显著的改进。