我对同一项目测试了8个AI编程代理。结果:四分之一个可用于生产,总成本1.94美元。
摘要
对8个AI编程代理在构建VPS管理工具包上的基准测试发现,四个实现中只有一个可投入生产,总成本1.94美元,规划与代码成本比为1:28。
我需要构建一个VPS管理工具包。我没有自己写,而是把它变成了一个可复现的基准测试:相同的功能概要,8种工具/模型组合,两个阶段(架构设计,然后代码编写),外部盲审。关键发现:8个模型在制定计划前没有一个提出澄清问题。每个都是先生成,后澄清——这和经验丰富的工程师的工作方式正好相反。工具封装层(Claude Code、Copilot CLI、OpenCode)对规划质量没有可测量的影响。相同模型=相同输出,无论使用什么工具。规划阶段成本:0.06美元。代码阶段成本:1.67美元。比例为1:28——这个比例解释了AI编码现实经济性的大部分原因。四个实现中,有一个被独立盲审评为可投入生产。总成本:1.94美元。估计在Copilot + Sonnet 4.6上的等效成本:约25美元。区分模型的因素:获胜的实现会在会话期间进行自我测试,捕获了两个Pydantic v2验证错误,修复了一个sed替换问题,并实现了37/37测试通过。其他实现交付后就停止了。这种对输出负责的行为是区分生产就绪与非生产就绪的关键。完整的方法论、评分表以及所有四个实现都在公共仓库中。如果你想挑战这个结果,它是可复现的。
相似文章
@IntuitMachine:你的AI编程代理仅修复一个bug就烧掉2美元。你以为这是“廉价自动化”。以下是16,000次生产运行揭示的真相…
对AI编程代理成本的分析显示,代理工作流消耗的token数可达简单ChatGPT调用的3500倍,大部分浪费来自冗余的上下文加载。文章建议追踪重复的文件操作并使用高效模型降低成本。
又一个基准测试:解决相同任务,0.34美元对比27.60美元
Archestra分享了他们通过在实际客户工作流中运行弱模型来调试产品缺陷,从而对AI智能体进行基准测试的方法。结果显示,像开放权重模型这样更便宜的模型可以以极低的成本(0.34美元对比27.60美元)获得类似的结果。
AI代理在生产环境中目前能做什么?分享三个月来有效和失效的经验
在3个SaaS产品中运行AI代理3个月后,作者分享了哪些有效(GitHub MCP、Postgres MCP、Playwright MCP)以及哪些失效(长任务、认证壁垒、成本飙升、多工具编排错误),月成本约430美元。
质量差距不到2%但成本相差10倍:在相同的工具调用任务上测试5个模型[D]
一位开发者在工具调用任务上测试了五个AI模型,发现廉价模型的表现与Opus等昂贵模型相差不到2%,腾讯混元(Tencent's Hunyuan)成本低于1.50美元,而Opus为15美元,通过将简单任务路由到廉价模型,每日成本从40美元降至9美元。
我的多智能体AI系统在我注意到之前就烧掉了大约1800美元。你们是如何追踪智能体成本的?
一位开发者分享了多智能体AI系统意外高昂成本的个人经历,引发了关于智能体框架中成本追踪和可观测性的讨论。