我对同一项目测试了8个AI编程代理。结果:四分之一个可用于生产,总成本1.94美元。

Reddit r/ArtificialInteligence 新闻

摘要

对8个AI编程代理在构建VPS管理工具包上的基准测试发现,四个实现中只有一个可投入生产,总成本1.94美元,规划与代码成本比为1:28。

我需要构建一个VPS管理工具包。我没有自己写,而是把它变成了一个可复现的基准测试:相同的功能概要,8种工具/模型组合,两个阶段(架构设计,然后代码编写),外部盲审。关键发现:8个模型在制定计划前没有一个提出澄清问题。每个都是先生成,后澄清——这和经验丰富的工程师的工作方式正好相反。工具封装层(Claude Code、Copilot CLI、OpenCode)对规划质量没有可测量的影响。相同模型=相同输出,无论使用什么工具。规划阶段成本:0.06美元。代码阶段成本:1.67美元。比例为1:28——这个比例解释了AI编码现实经济性的大部分原因。四个实现中,有一个被独立盲审评为可投入生产。总成本:1.94美元。估计在Copilot + Sonnet 4.6上的等效成本:约25美元。区分模型的因素:获胜的实现会在会话期间进行自我测试,捕获了两个Pydantic v2验证错误,修复了一个sed替换问题,并实现了37/37测试通过。其他实现交付后就停止了。这种对输出负责的行为是区分生产就绪与非生产就绪的关键。完整的方法论、评分表以及所有四个实现都在公共仓库中。如果你想挑战这个结果,它是可复现的。
查看原文

相似文章

又一个基准测试:解决相同任务,0.34美元对比27.60美元

Reddit r/LocalLLaMA

Archestra分享了他们通过在实际客户工作流中运行弱模型来调试产品缺陷,从而对AI智能体进行基准测试的方法。结果显示,像开放权重模型这样更便宜的模型可以以极低的成本(0.34美元对比27.60美元)获得类似的结果。