在我的编码代理上,一个35B模型以95%对53%击败了120B模型。构建你自己的基准测试。
摘要
一位开发者为编码AI代理构建了自定义基准测试,并发现当测试框架优化时,一个35B参数模型优于120B参数模型,凸显了定制化评估相对于通用规格的重要性。
我正在从头构建一个AI代理,我需要做出的一个决定是使用哪个开源模型。起初,我打算使用GPT-OSS-120B,它大约是Qwen3.6-35B的四倍大小。我假设更大的模型在所有方面都会明显更好。但事实并非如此。为了测试这一点,我构建了自己的自定义基准测试。当涉及到你自己的测试框架时,你不能信任通用的排行榜或纯规格。Qwen3.6-35B在基准测试上达到了95%的pass@1分数。GPT-OSS-120B在同一测试中仅通过了53%。它们都接受了相同的19个任务,并用相同的测试框架进行评估。我特意选择了一个随机的大型模型,因为它易于启动,只是为了看看它开箱即用的表现。然而,在开发过程中,测试框架是专门针对Qwen3.6-35B模型调优的,因此分数差异巨大。这表明,为你的模型优化测试框架至少和规格本身一样重要。这就是为什么我仍然对从Claude Code切换到Pi用于日常工作持怀疑态度。(类似于苹果与Linux生态的故事)关于我的基准测试的一些细节:这19个任务分为7个简单、6个中等和6个困难任务,风格类似于Terminal-Bench。对于每个任务,都会给出一个指令,以及一个带有种子和隐藏验证器的仓库,验证器评估最终状态并分配0或1的奖励。代理在沙箱中运行,并能够以git分支的形式返回其工作。隐藏测试仅在代理运行后插入到环境中,以避免泄露任何解决方案线索。验证器本身是代码,而不是其他大型语言模型。例如,如果代理修改了仓库中除目标文件以外的文件,或者在一个文件中修改了超过8行代码,任务就会失败。我使用Opik作为可观测性和评估系统来跟踪代理轨迹、管理数据集版本,并将每次运行存储为实验。在这种情况下,比较两个模型就像比较两个实验一样简单。这个设置还揭示了成本分析。我使用两种不同的支付模型在相同的工作负载上运行相同的模型(Qwen3.6-35B):按令牌付费(OpenRouter)和按GPU小时付费(Modal)。按令牌付费更便宜,1.2M令牌大约0.13美元,而在Modal上同样的东西花费0.46美元。GPU大部分时间都在等待处理一个测试,而你为整个会话付费。只有当你可以批处理多个任务并保持100%持续运行时,按GPU付费才便宜。最终,模型大小和排行榜排名只有在一定程度上有用。除非你在自己的用例中测试你的代理,否则你永远无法信任关于性能、成本或延迟的通用报告。你找到可以插入你测试框架的开源模型的最佳策略是什么?无论是使用代理还是从头构建测试框架。不允许凭感觉。
相似文章
我用4B参数模型构建的编码智能体在基准测试中达到87%,诀窍如下
作者构建了SmallCode,一个针对小型本地模型优化的编码智能体,通过复合工具、改进循环和令牌预算等技术,在4B参数模型上实现了87%的基准测试成功率。
@Ali_TongyiLab: https://x.com/Ali_TongyiLab/status/2067158015615041755
AgentScope团队推出了PawBench,这是一个用于评估模型与代理框架综合性能的基准测试。通过对4,050个测试单元的分析,结果表明框架选择的影响堪比模型升级。
AA 推出 Coding Agent Index —— 模型与 Harness 组合的性能对比
Artificial Analysis 推出了 Coding Agent Index,这是一套新的基准测试套件,结合了 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,旨在评估 AI 编程代理在多样化任务中的表现。
未调优的27B模型在智能体任务中击败了调优的75B模型
一项比较显示,未调优的27B参数模型在智能体任务中优于调优的75B参数模型,凸显了扩展和微调可能存在的低效问题。
相同模型,相同提示词,两个代理框架:45/50 vs 43/50
文章对相同的deepseek-v4-flash模型上的两个开源编码代理进行了基准测试,发现任务成功率相似,但在性能指标上存在显著差异,并且一个代理的错误处理中存在一个关键漏洞。