Token消耗狂飙正成为一类生产事故。你如何为AI代理费用设置上限?
摘要
AI代理导致Token消耗失控,使超支成为一类生产事故。文章列举了诸如一位工程师130万美元的OpenAI账单以及Uber在四个月内烧掉全年AI预算等案例,并向社区询问如何为代理费用设置上限。
员工使用AI代理来实现内部生产力目标,代理消耗的Token数量是标准聊天交互的50-1000倍。一位工程师的OpenAI账单:130万美元。单月。Uber在4个月内烧掉了全年AI预算。这现在是一个生产系统问题,而不仅仅是财务问题。代理遇到意外状态并重试。生成子代理。调用LLM 800次而不是8次。等到你的监控发现时,账单已经打印出来了。我们使用断路器、资源限制、ulimits来处理失控进程。没有人对代理层应用同样的纪律。你对此做了什么:\- 每个代理会话的硬上限?\- 每个用户的每日限制?\- 仅仅监控并希望?\- 完全不同的做法?寻找在生产中实际有效的方法,而不是理论上听起来不错的方法。
相似文章
Meta在2026年内部AI代币支出接近数十亿后设定上限
在2026年员工使用成本接近数十亿后,Meta正在限制内部AI代币支出,实施集中监控和正式代币预算以遏制“tokenmaxxing”行为。
Tokenmaxxing 已死,Tokenmaxxing 永存
对 Meta 等公司的“tokenmaxxing”现象的分析,认为高管们故意鼓励浪费 AI token 使用以推动工具采用,这与意外管理不善的看法相反。
Ramp 扩大代币支出追踪功能,针对 AI 最快增长成本(4 分钟阅读)
Ramp 扩展了其 AI 代币支出管理产品,为财务团队提供跨 OpenAI、Anthropic 和 Google 等提供商的统一追踪和控制,帮助发现节省成本的机会。
Tokenmaxing已过时 - 节约型AI成新趋势
Tokenmaxing(无限AI令牌使用)的时代正在结束,因为企业面临高昂成本和生态破坏,取而代之的是tokenminimizing——注重效率并为任务选择合适的AI模型。
Meta应用AI团队士气跌至历史最低,面临数十亿美元成本危机
Meta的应用AI部门士气跌至历史最低,并面临数十亿美元的成本危机。员工为了应对与AI消耗挂钩的绩效指标,人为夸大AI token使用量('tokenmaxxing'),引发内部反抗和严格的token预算。