@IntuitMachine:你的AI编程代理仅修复一个bug就烧掉2美元。你以为这是“廉价自动化”。以下是16,000次生产运行揭示的真相…
摘要
对AI编程代理成本的分析显示,代理工作流消耗的token数可达简单ChatGPT调用的3500倍,大部分浪费来自冗余的上下文加载。文章建议追踪重复的文件操作并使用高效模型降低成本。
查看缓存全文
缓存时间: 2026/05/23 18:15
你的AI编码代理仅修复一个bug就烧掉2美元。
你以为那是“廉价自动化“。
这是16,000次生产运行揭示的你资金真正去向。
代理式编码比ChatGPT多消耗3500倍token。
相同模型。相同API。
区别?代理在数十轮交互中积累上下文——而其中大部分只是反复读取同一文件。
戏剧性转折:更多token = 更差结果。
触及1M+ token的任务成功率低于在300K停止的任务。
你的代理并非思考更深入。它被困在循环里了。
相同任务、相同模型,30倍的成本差异。
第1次运行:100K token
第2次运行:3M token
代理式工作流就像老虎机——你支付的是平均值,而非最小值。
GPT-5系列:每个任务约500K token
Claude 4.5:每个任务约2M token
两者都能解决问题。
但一个成本低4倍。 效率 ≠ 能力了。
工程师对任务难度评分:“困难” vs “简单”
代理token成本相关性:0.32
翻译过来:人类的复杂性 ≠ AI的复杂性。
对你来说微不足道的事,可能让你的API预算破产。
95%的成本 = 输入token
为什么?代理会持续:
• 重新查看同一文件 • 每轮重新加载上下文 • 探索死胡同而不剪枝
缓存有帮助。但冗余才是真正的杀手。
token的流向:
探索阶段:40–60% 修复阶段:20–30% 验证阶段:10–20%
大多数浪费在代理写出一行代码之前就已经发生。
代理能预测自身成本吗?
研究人员让GPT-5估算token使用量。
结果:r = 0.39的相关性
比随机好——但你敢信任只有40%精度的油量表吗?
今天就能降低成本的3种方法:
追踪重复文件操作——杀死超过30%的不必要运行 将任务路由到高效模型,而不仅仅是智能模型 使用自我预测作为预算预警的预过滤器
大胆断言:“更多推理“就是新的“更多参数”
两者都有帮助……直到它们不再有帮助。
最好的代理不是那个探索一切的。
而是那个知道何时停下来的。
别再为循环买单。开始衡量真正重要的东西。
相似文章
运行AI代理最昂贵的部分不是令牌消耗,而是花在弄清楚它们行为原因的时间。
构建AI代理的过程揭示,主要成本在于调试——花费数周追踪诸如上游API变更等问题——而不仅仅是令牌或模型推理成本。
我的多智能体AI系统在我注意到之前就烧掉了大约1800美元。你们是如何追踪智能体成本的?
一位开发者分享了多智能体AI系统意外高昂成本的个人经历,引发了关于智能体框架中成本追踪和可观测性的讨论。
一个用于文件检索的AI代理意外启动了829个Claude实例,数小时内消耗了价值4万美元的API使用量
一个用于文件检索的AI代理意外启动了829个Claude实例,在数小时内产生了4万美元的API费用,凸显了未受控代理循环的风险。
AI智能体
分析高盛研究,对比AI智能体与人类在编码、支持和数据录入方面的成本,并预测token消耗增长及推理成本下降。讨论生产力提升、岗位替代及医疗健康领域的机遇。
我对同一项目测试了8个AI编程代理。结果:四分之一个可用于生产,总成本1.94美元。
对8个AI编程代理在构建VPS管理工具包上的基准测试发现,四个实现中只有一个可投入生产,总成本1.94美元,规划与代码成本比为1:28。