@joelniklaus: Codex 对大型模型过度优化:在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9!几乎……

X AI KOLs Timeline 新闻

摘要

一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。

Codex 对大型模型过度优化:它在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9! 这个领域的几乎所有精力都花在调整权重上。我们想知道最终数字中有多少是由包裹在模型之外的框架(harness)决定的,因此我们在 SWE-bench Pro 上让 10 个编码智能体框架分别对接两个模型进行了测试。 事实证明,影响很大。更换框架使 GLM-5.2 的 pass@1 从 23% 提升到 52%,使 Gemma 4 26B-A4B 的 pass@1 从 15% 提升到 36%——这个差距比大多数模型版本更新带来的提升还要大。 而且排名并不迁移。两个模型的框架排行榜之间的秩相关为 -0.05,也就是说:完全不相关。 Codex 并非个例。每个由模型厂商发布的框架,在小模型上都会排名下降——Codex 从第 2 跌到第 9,Claude Code 从第 3 跌到第 7,Qwen Code 从第 4 跌到第 6——而与模型无关的框架则排名上升:crush 从第 7 升到第 1,opencode 从第 8 升到第 2,pi 从第 9 升到第 4。 最明显的例子是 crush:它在 GLM-5.2 上排名第 7,在 Gemma 4 上排名第 1。在两者上运行相同的脚手架,小模型以 4 个百分点的优势获胜,而价格仅为十二分之一:每个任务 $0.30,对比 $3.61。 Gemma 4 的最佳框架击败了 GLM-5.2 最差的四个框架。一个 26B 模型配上合适的脚手架,与一个 744B 模型配上不合适的脚手架,表现相去不远。 每个已解决任务的成本:Gemma 4 + crush 为 $0.84,pass@1 为 36%。而 GLM-5.2 得分相当的最便宜配置是 openclaw,pass@1 为 38%,成本 $7.05。 各框架每个任务的输出 token 数从 16k 到 621k 不等:你为此支付的成本有 39 倍的差异,但买到的性能只有 2 倍的差异。 97% 的输入 token 是重新发送的对话前缀,因此提示缓存(prompt caching)非常重要。 实验设置:每个框架在相同的 250 个 SWE-bench Pro 任务上分别运行两个模型,每种组合各跑一次,按各框架实际消耗 token 的 API 挂牌价计费。图中,深色圆圈表示该组合在同时考虑两个模型时位于帕累托前沿上,淡色圆点表示你可以在其他组合上用更低成本获得更高分数;为了清晰起见,10 个框架中有 2 个(goose 和 hermes)未在图中显示。
查看原文
查看缓存全文

缓存时间: 2026/08/08 07:01

Codex 为大型模型做了过度优化:它在 GLM 5.2 的 10 个 harness 中排名第 2,但在 Gemma-4 上却跌至第 9!

这个领域里几乎所有的精力都花在了调整模型权重上。我们想知道,最终的分数在多大程度上是由包裹在模型外面的 harness 决定的,而不是由权重决定的。于是我们在 SWE-bench Pro 上用两个模型跑了 10 个编码智能体 harness。

事实证明,影响很大。更换 harness 后,GLM-5.2 上的 pass@1 从 23% 上升到 52%,Gemma 4 26B-A4B 上则从 15% 上升到 36%——这个差距比大多数模型版本更新带来的提升还要大。

而且排名并不转移。两个模型的 harness 排行榜之间的秩相关系数是 -0.05,也就是说:完全没有相关性。

Codex 并不孤单。所有由模型厂商随模型发布的 harness,在小模型上排名都会下降——Codex 从第 2 跌到第 9,Claude Code 从第 3 跌到第 7,Qwen Code 从第 4 跌到第 6——而与模型无关的 harness 则排名上升:crush 从第 7 升到第 1,opencode 从第 8 升到第 2,pi 从第 9 升到第 4。

最典型的例子是 crush:它在 GLM-5.2 上排第 7,在 Gemma 4 上排第 1。对两者运行完全相同的脚手架,小模型以 4 个百分点的优势胜出,价格却只有后者的十二分之一:每个任务 $0.30 对 $3.61。

Gemma 4 的最佳 harness 击败了 GLM-5.2 的四个最差 harness。一个 26B 的模型配上合适的脚手架,和一个 744B 的模型配上不合适的脚手架,相差并不大。

每个已解决任务的平均成本:Gemma 4 + crush 为 $0.84(通过率 36%)。GLM-5.2 上能达到同等分数的最便宜配置是 openclaw,通过率 38%,成本 $7.05。

各 harness 在每个任务上的输出 token 数从 16k 到 621k 不等:你支付的费用相差 39 倍,但得到的回报只相差 2 倍。

输入 token 中有 97% 是重复发送的对话前缀,因此提示词缓存(prompt caching)非常重要。

实验设置:每个 harness 都在同样的 250 个 SWE-bench Pro 任务上对两个模型各运行一次,每个任务各 rollout 一次,并按各 harness 实际消耗的 token 以 API 列表价格计费。在图中,深色圆圈表示该组合位于两个模型共同构成的 Pareto 前沿上;淡色圆点表示你可以在别处用更少的钱获得更高分数。为了图示清晰,10 个 harness 中有 2 个(goose 和 hermes)未在图中显示。

相似文章