你的多智能体设置可以把15美元/天变成225–750美元/天 — 而79%的失败源于规格和协调问题
摘要
多智能体系统的成本可能是单个智能体的15–50倍,但大多数失败源于规格模糊和协调崩溃,而非模型能力。建议将交接视为API契约,并增加明确的验证。
.:: 多智能体系统的成本跃升很容易被低估。一个具有良好上下文管理的智能体工作流每天大约花费15美元,而一旦多个智能体反复交接上下文、辩论、重试、总结并互相验证,成本可能变成225–750美元/天。而这些额外支出往往并不能解决系统失败的主要原因。
MAST失败分类法分析了七个流行多智能体框架中的1600多个带注释的执行轨迹:
规格模糊:41.77%
协调崩溃:36.94%
验证缺口:21.30%
因此,78.71%的观察到的失败来自规格和协调——而非模型能力。
Tran & Kiela的一项独立对照研究,在Qwen3、DeepSeek-R1-Distill-Llama和Gemini 2.5上,给单智能体和多智能体系统相同的推理token预算。在多跳推理上,单智能体系统始终达到或超过多智能体变体。
我认为,在添加另一个智能体之前,让第一次交接变得极其明确:
输入/输出模式
每个状态字段的所有权
约束和允许的操作
成功标准
独立验证步骤
把智能体交接视为API契约,而不是“两个智能模型在对话”。
披露:我在做智能体记忆/上下文基础设施(metronix memory)。这篇文章不是关于产品的;而是关于文献和我们自己的失败所暗示的内容。
相似文章
@alex_prompter:多智能体 AI 系统会在四个环节出问题。路由误触发,并行永不发生,交接丢失上下文,以及覆盖…
多智能体AI系统通常会在路由、并行、交接和覆盖方面出问题。本文推荐使用分派矩阵、并行执行、结构化交接和带日志的兜底后备方案来修复这些问题。
在实践中,我们的多智能体失败几乎从来不是模型的问题——而是交接环节的问题。MAST数据是否符合您的观察?
对多智能体LLM流水线失败的分析,引用伯克利MAST论文,该论文将大多数失败归因于协调问题(规范、智能体间不一致)而非模型能力,并建议使用专用验证智能体作为解决方案。
"在什么情况下添加另一个代理实际上会损害您的系统?问这个是因为我的6代理流水线比旧的2代理流水线更慢且更不可靠"
一位开发者分享了使用AI编排框架(LangGraph, CrewAI, AutoGen)的真实体验,指出了原型设计便捷性与生产可靠性之间的权衡,并向社区询问如何处理失败、人机协同和Token成本问题。
多智能体系统与单智能体系统
本文指出,大多数所谓的“智能体化”系统实际上只是配备工具的单智能体,并强调了多智能体架构带来的高昂成本和复杂性。文章梳理了三种有效的多智能体模式——编排者-工作者、流水线以及点对点模式,并提供了判断何时采用多智能体而非单智能体的标准。
多智能体系统是否已准备好投入生产?
一位开发者分享了对多智能体系统的挫败感,指出它们比单智能体系统复杂得多,且结果往往更差,并寻求关于协调和减少复杂性的工具建议。