相同模型,相同提示词,两个代理框架:45/50 vs 43/50

Reddit r/AI_Agents 新闻

摘要

文章对相同的deepseek-v4-flash模型上的两个开源编码代理进行了基准测试,发现任务成功率相似,但在性能指标上存在显著差异,并且一个代理的错误处理中存在一个关键漏洞。

通过两个开源编码代理运行了从合并PR重建的50个任务,均基于deepseek-v4-flash模型。相同模型,相同的系统提示词通过一个在漂移时失败的同步脚本写入两个配置,相同的密封容器,两者均无网络访问。由每个项目自身的保留测试加上一个3模型评审面板进行评分。45/50 对 43/50,评审平均分 88.6 对 85.6。成本相差无几,整个运行分别为 $1.59 和 $1.53。五十个案例中两个案例的差异不足以作为唯一依据。更有趣的差异在于挂钟时间,这让我意识到不能盲目相信自己的平均值。在平均值上,我们的系统每个案例看起来慢了2分钟。在中位数上,分别为5.5对7.0,并且逐个案例比较,我们的系统在50个中有31个更快。整个平均差距源于一个单一案例,一个两个代理都失败的React水合错误,我们的系统运行了271分钟和1322步后放弃,而另一个在63步时退出。我们的无进展检测显然没有触发。这是一个真正的漏洞,而非测量误差,也是本次运行中最差的单个结果。几乎相同的花费也换来了非常不同的工作形态:输出令牌分别为1.5M和573K,推理令牌分别为1.0M和1.3M。披露:我们的系统是octomind,因此这是我们的基准测试和我们的偏见。仓库链接在评论中,按照子版块规则。发布主要是因为我没有看到很多相同模型的框架比较,我想知道是否有人在我们未拥有的基准测试上运行过。
查看原文

相似文章