如果你的智能体学到了任何东西,为什么 Run 10 的成本和 Run 1 一样?
摘要
对AI智能体token消耗的批判;提出Token投资回报率(ROTI)作为效率指标,指出大多数智能体不会随着时间减少token使用量。
Jensen Huang 曾说过,如果工程师不在AI计算上大量投入,他会"深感担忧"。Meta建立了一个内部排行榜,追踪其85,000名员工中谁消耗的token最多——发放"Token Legend"徽章,30天内消耗了60.2万亿个token。该排行榜在人们开始为了排名而刷数据后被撤下。该领域最有影响力的声音正在将消耗量作为产出的代理指标。比尔·盖茨曾说过,用代码行数来衡量软件进度就像用重量来衡量飞机制造。我们正在以更大的规模犯同样的错误。那么为什么我们不以token ROI来衡量呢?ROTI——Token投资回报率。一个成熟的智能体工作流应该随着时间使用更少的token。如果智能体真的学会了你的任务,第10次运行应该比第1次更快更便宜。这才是学习的样子。大多数智能体并非如此。无论你运行同一个工作流多少次,token花费都保持不变。没有任何信号显示有所改进。你并不是在建立杠杆——你只是在重复租用计算资源。你实际上用什么来判断一个智能体是否在尽职尽责?
相似文章
子代理在长代理运行中占据大部分Token成本:实际可将使用量降低70%至90%的修复方法
本文分析了 Bai 等人 2026 年的论文,该论文表明,子代理和上下文膨胀导致长代理运行中的Token成本比普通聊天高出约1000倍,并提出了三种实用的修复方法(PLAN.md、读取预算、带外备注),可将Token使用量减少70-90%。
运行AI代理最昂贵的部分不是令牌消耗,而是花在弄清楚它们行为原因的时间。
构建AI代理的过程揭示,主要成本在于调试——花费数周追踪诸如上游API变更等问题——而不仅仅是令牌或模型推理成本。
你们究竟是如何降低 Agent 系统成本的?
本文探讨了 AI Agent 系统在成本优化和 FinOps 方面面临的挑战,指出了 Token 账单不可预测、缺乏细粒度归因工具等问题,并提到了缓存和硬性限制等应对策略。
你在生产环境中如何对多个AI智能体处理Token预算?
关于在生产环境中部署多个AI智能体时管理Token预算策略的讨论,涵盖成本与效率考虑。
将我的Agent令牌消耗削减72%(每个任务11.9k ➝ 3.3k)。以下是我所做的具体改动,附数据
一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。