我们是否默认过度配置了AI智能体?
摘要
文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。
我一直在思考多智能体系统中的模型选择,尤其是随着前沿模型越来越多地针对编码和长期软件工程工作进行优化。这些模型非常出色。但很多智能体工作并不是复杂的编码——甚至不是深度推理。想想典型工作流中的调用:对消息进行分类或路由;提取几个结构化字段;总结文档;翻译或改写文本;搜索文档或日志;根据预定义标准比较记录;调用定义良好的API;验证输出;更新数据库或CRM;处理重试、记账或状态跟踪。规划器或审查者可能确实需要前沿级别的推理。分类器或提取器通常不需要。这让我想知道我们是否在以一种错误的方式思考模型选择。与其问:“我能使用的最聪明的模型是什么?”也许工程问题应该是:“对于这个特定任务,最便宜的、能够可靠达到质量门槛的模型是什么?”
一个粗略的成本示例
假设一个多智能体系统每天进行10,000次模型调用。为了进行一个刻意简单的比较,假设每次调用的平均值为:2,000个输入token;500个输出token。使用同一系列三个模型的当前标准短上下文定价,大致得出:旗舰模型:每次平均调用0.025美元;主力模型:0.010美元;经济模型:0.001美元。
现在比较三种架构。
1. 所有调用都使用旗舰模型
每天10,000次调用 → 每月约7,500美元。
2. 80%主力 / 20%旗舰
相同调用次数 → 每月约3,900美元。
3. 60%经济 / 30%主力 / 10%旗舰
相同调用次数 → 每月约1,830美元。
在这些特定假设下,这与全旗舰配置相差75.6%。显然,这不是预测,也不是通用的路由方案。不同的工作负载具有非常不同的token分布和质量要求,实际成本还取决于缓存、重试、上下文大小、推理token、工具调用等。更重要的是,这个想法并不是为了省钱而接受更差的结果。其假设是,更便宜的模型只处理那些已经达到所需质量和可靠性门槛的任务,而困难、模糊、高价值或高风险的工作则会被升级。
编码的角度似乎也很重要
前沿模型越来越多地被推向编码、Agent式编码、终端工作、工具使用以及长周期软件工程。这在经济上和技术上都是合理的。但是,如果一个智能体系统将其大部分调用用于总结、分类、提取、翻译、路由、监控、调用确定性工具,或执行其他结构化操作工作,那么在困难编码任务上的基准领先地位并不一定会转化为每一次调用中的相应价值。因此,我越来越将模型能力视为一种基础设施资源——一种根据任务难度、不确定性、价值和风险来分配的资源,而不是为整个系统选择的单一默认配置。对于运行真实智能体工作流的人:你们是否将不同任务路由到不同的模型层级,还是仍然对几乎所有事情使用一个强大的模型?如果你们确实进行了路由,那么在决定任务何时应该升级到前沿模型时,哪些信号实际上效果良好?
相似文章
AI agents 正在改变人们对计算成本的看法
本文讨论了AI代理工作流如何将优化重心从单纯的推理成本转向更广泛的挑战,如延迟、编排开销和可靠性。文章强调了向混合架构和动态模型路由发展的趋势,以应对这些多步骤工作流的复杂性。
越过演示阶段,智能体系统在何处悄悄浪费开销
本文探讨了AI智能体系统在生产环境中因过度上下文、不恰当的模型选择及重试等隐藏低效而浪费开销的现象,并质疑哪些运行时决策应控制模型调用。
前沿模型是否正在成为不需要它们的任务的默认选择?
文章讨论了大多数AI流量由简单、可重复的任务组成,如分类和提取,然而前沿模型常常被用于所有事情。它质疑将任务路由到较小的专用模型是否会成为降低成本和延迟的标准做法。
你们究竟是如何降低 Agent 系统成本的?
本文探讨了 AI Agent 系统在成本优化和 FinOps 方面面临的挑战,指出了 Token 账单不可预测、缺乏细粒度归因工具等问题,并提到了缓存和硬性限制等应对策略。
AI智能体真的在为你节省时间吗?
探讨AI智能体是否真的在真实工作流程中为用户节省时间,还是监控和纠正它们会带来新的额外负担。