AI agents 正在改变人们对计算成本的看法
摘要
本文讨论了AI代理工作流如何将优化重心从单纯的推理成本转向更广泛的挑战,如延迟、编排开销和可靠性。文章强调了向混合架构和动态模型路由发展的趋势,以应对这些多步骤工作流的复杂性。
我们最近在代理工作流中注意到一种模式:推理成本不再是团队唯一优化的目标。一旦代理变得多步骤且工具密集,真正的瓶颈开始出现:
* 延迟累积
* 编排开销
* 重试循环
* 上下文增长
* 并发执行
* 长时间运行任务下的可靠性
有趣的是,这也改变了人们分配工作负载的方式:
* 对结构化任务使用更小/更快的模型
* 仅在必要时使用更大的推理模型
* 混合本地+云端执行
* 模型之间的动态路由
感觉行业正在慢慢从“一个模型做所有事”转向更注重工作负载感知的架构。好奇其他人在生产环境中看到什么。对你来说,更大的约束是什么:计算成本、延迟、编排复杂性还是可靠性?
相似文章
你们究竟是如何降低 Agent 系统成本的?
本文探讨了 AI Agent 系统在成本优化和 FinOps 方面面临的挑战,指出了 Token 账单不可预测、缺乏细粒度归因工具等问题,并提到了缓存和硬性限制等应对策略。
我们是否默认过度配置了AI智能体?
文章认为,许多AI智能体工作流将每个任务都路由到前沿模型,浪费了资金,并建议对简单、结构化的任务使用更便宜的模型层级,同时将更困难的任务升级。文章提供了一个成本比较,显示分层方法可节省高达75%的费用。
AI智能体
分析高盛研究,对比AI智能体与人类在编码、支持和数据录入方面的成本,并预测token消耗增长及推理成本下降。讨论生产力提升、岗位替代及医疗健康领域的机遇。
到2028年,运行AI代理的成本将增加五倍
Gartner 预测,由于效率提升使得更强大的模型和应用成为可能,每个代理工作流的AI推理成本到2028年将增加五倍以上,却矛盾地提高了总体成本。
AI智能体可能成为自互联网以来最大的生产力转变
本文认为,AI智能体通过从回答问题转变为完成任务,代表了生产力的重大转变,并讨论了当前的使用案例和瓶颈。