Token消耗狂飙正成为一类生产事故。你如何为AI代理费用设置上限?

Reddit r/AI_Agents 新闻

摘要

AI代理导致Token消耗失控,使超支成为一类生产事故。文章列举了诸如一位工程师130万美元的OpenAI账单以及Uber在四个月内烧掉全年AI预算等案例,并向社区询问如何为代理费用设置上限。

员工使用AI代理来实现内部生产力目标,代理消耗的Token数量是标准聊天交互的50-1000倍。一位工程师的OpenAI账单:130万美元。单月。Uber在4个月内烧掉了全年AI预算。这现在是一个生产系统问题,而不仅仅是财务问题。代理遇到意外状态并重试。生成子代理。调用LLM 800次而不是8次。等到你的监控发现时,账单已经打印出来了。我们使用断路器、资源限制、ulimits来处理失控进程。没有人对代理层应用同样的纪律。你对此做了什么:\- 每个代理会话的硬上限?\- 每个用户的每日限制?\- 仅仅监控并希望?\- 完全不同的做法?寻找在生产中实际有效的方法,而不是理论上听起来不错的方法。
查看原文

相似文章

Tokenmaxxing 已死,Tokenmaxxing 永存

Hacker News Top

对 Meta 等公司的“tokenmaxxing”现象的分析,认为高管们故意鼓励浪费 AI token 使用以推动工具采用,这与意外管理不善的看法相反。

Tokenmaxing已过时 - 节约型AI成新趋势

Reddit r/ArtificialInteligence

Tokenmaxing(无限AI令牌使用)的时代正在结束,因为企业面临高昂成本和生态破坏,取而代之的是tokenminimizing——注重效率并为任务选择合适的AI模型。