你的多智能体设置可以把15美元/天变成225–750美元/天 — 而79%的失败源于规格和协调问题

Reddit r/AI_Agents 新闻

摘要

多智能体系统的成本可能是单个智能体的15–50倍,但大多数失败源于规格模糊和协调崩溃,而非模型能力。建议将交接视为API契约,并增加明确的验证。

.:: 多智能体系统的成本跃升很容易被低估。一个具有良好上下文管理的智能体工作流每天大约花费15美元,而一旦多个智能体反复交接上下文、辩论、重试、总结并互相验证,成本可能变成225–750美元/天。而这些额外支出往往并不能解决系统失败的主要原因。 MAST失败分类法分析了七个流行多智能体框架中的1600多个带注释的执行轨迹: 规格模糊:41.77% 协调崩溃:36.94% 验证缺口:21.30% 因此,78.71%的观察到的失败来自规格和协调——而非模型能力。 Tran & Kiela的一项独立对照研究,在Qwen3、DeepSeek-R1-Distill-Llama和Gemini 2.5上,给单智能体和多智能体系统相同的推理token预算。在多跳推理上,单智能体系统始终达到或超过多智能体变体。 我认为,在添加另一个智能体之前,让第一次交接变得极其明确: 输入/输出模式 每个状态字段的所有权 约束和允许的操作 成功标准 独立验证步骤 把智能体交接视为API契约,而不是“两个智能模型在对话”。 披露:我在做智能体记忆/上下文基础设施(metronix memory)。这篇文章不是关于产品的;而是关于文献和我们自己的失败所暗示的内容。
查看原文

相似文章

多智能体系统与单智能体系统

Reddit r/AI_Agents

本文指出,大多数所谓的“智能体化”系统实际上只是配备工具的单智能体,并强调了多智能体架构带来的高昂成本和复杂性。文章梳理了三种有效的多智能体模式——编排者-工作者、流水线以及点对点模式,并提供了判断何时采用多智能体而非单智能体的标准。

多智能体系统是否已准备好投入生产?

Reddit r/AI_Agents

一位开发者分享了对多智能体系统的挫败感,指出它们比单智能体系统复杂得多,且结果往往更差,并寻求关于协调和减少复杂性的工具建议。