在我的编码代理上,一个35B模型以95%对53%击败了120B模型。构建你自己的基准测试。

Reddit r/AI_Agents 新闻

摘要

一位开发者为编码AI代理构建了自定义基准测试,并发现当测试框架优化时,一个35B参数模型优于120B参数模型,凸显了定制化评估相对于通用规格的重要性。

我正在从头构建一个AI代理,我需要做出的一个决定是使用哪个开源模型。起初,我打算使用GPT-OSS-120B,它大约是Qwen3.6-35B的四倍大小。我假设更大的模型在所有方面都会明显更好。但事实并非如此。为了测试这一点,我构建了自己的自定义基准测试。当涉及到你自己的测试框架时,你不能信任通用的排行榜或纯规格。Qwen3.6-35B在基准测试上达到了95%的pass@1分数。GPT-OSS-120B在同一测试中仅通过了53%。它们都接受了相同的19个任务,并用相同的测试框架进行评估。我特意选择了一个随机的大型模型,因为它易于启动,只是为了看看它开箱即用的表现。然而,在开发过程中,测试框架是专门针对Qwen3.6-35B模型调优的,因此分数差异巨大。这表明,为你的模型优化测试框架至少和规格本身一样重要。这就是为什么我仍然对从Claude Code切换到Pi用于日常工作持怀疑态度。(类似于苹果与Linux生态的故事)关于我的基准测试的一些细节:这19个任务分为7个简单、6个中等和6个困难任务,风格类似于Terminal-Bench。对于每个任务,都会给出一个指令,以及一个带有种子和隐藏验证器的仓库,验证器评估最终状态并分配0或1的奖励。代理在沙箱中运行,并能够以git分支的形式返回其工作。隐藏测试仅在代理运行后插入到环境中,以避免泄露任何解决方案线索。验证器本身是代码,而不是其他大型语言模型。例如,如果代理修改了仓库中除目标文件以外的文件,或者在一个文件中修改了超过8行代码,任务就会失败。我使用Opik作为可观测性和评估系统来跟踪代理轨迹、管理数据集版本,并将每次运行存储为实验。在这种情况下,比较两个模型就像比较两个实验一样简单。这个设置还揭示了成本分析。我使用两种不同的支付模型在相同的工作负载上运行相同的模型(Qwen3.6-35B):按令牌付费(OpenRouter)和按GPU小时付费(Modal)。按令牌付费更便宜,1.2M令牌大约0.13美元,而在Modal上同样的东西花费0.46美元。GPU大部分时间都在等待处理一个测试,而你为整个会话付费。只有当你可以批处理多个任务并保持100%持续运行时,按GPU付费才便宜。最终,模型大小和排行榜排名只有在一定程度上有用。除非你在自己的用例中测试你的代理,否则你永远无法信任关于性能、成本或延迟的通用报告。你找到可以插入你测试框架的开源模型的最佳策略是什么?无论是使用代理还是从头构建测试框架。不允许凭感觉。
查看原文

相似文章