多智能体优势的幻觉
摘要
本文挑战了多智能体系统优于单智能体系统的普遍说法,通过系统评估证明了自动生成的多智能体架构在性能上不如使用自一致性的思维链(CoT-SC),同时成本却高出高达10倍,并揭示了当前自动设计范式中的架构臃肿问题。
arXiv:2606.13003v1 公告类型:新
摘要:主流观点认为,多智能体系统(MAS)优于单智能体系统(SAS),其优势包括上下文保护、并行处理和分布式决策。然而,这一说法的实证支持主要依赖于与SAS基线的比较,而这些基线使用的基准测试侧重于孤立的推理任务,无法充分评估这些优势。本文聚焦于自动生成的MAS(旨在比手动设计的系统具有更强的泛化能力),针对SAS(特别是使用自一致性的思维链,CoT-SC)进行了严格的系统评估。在传统推理数据集以及具有交互式多步骤工作流的任务(例如BrowseComp-Plus)中,我们发现自动MAS的性能始终低于CoT-SC,尽管其成本最高可达10倍。为了将这些失败与任务结构固有的局限性区分开来,我们引入了一个专门为MAS设计的诊断性合成数据集,该数据集具有显式任务分解、上下文分离和并行化潜力。我们证明,在该数据集上,专家设计的MAS在原始性能和成本效率方面始终优于自动生成的架构,这表明现有的评估框架未能考虑增加计算成本的边际效用,从而掩盖了复杂MAS的关键架构缺陷和低效。关键的是,对生成的MAS架构的系统解构表明,当前的自动设计范式产生了架构臃肿,优先考虑表面复杂性而无法转化为功能效用,暴露了与多智能体原则的根本性脱节。
查看缓存全文
缓存时间: 2026/06/12 08:55
# 多智能体优势的幻觉 来源:https://arxiv.org/html/2606.13003 Prathyusha Jwalapuram1,∗ Hehai Lin2,∗ Chuyuan Li3 Fangkai Jiao4 Sudong Wang2 Yifei Ming1 Zixuan Ke1 Chengwei Qin2 Giuseppe Carenini3 Shafiq Joty1 ∗同等贡献 1Salesforce Research 2香港科技大学(广州) 3不列颠哥伦比亚大学 4南洋理工大学 ###### 摘要 普遍观点认为,多智能体系统(MAS)优于单智能体系统(SAS),其优势包括上下文保护、并行处理和分布式决策。然而,这一主张的经验支持主要依赖于与使用优先考虑孤立推理任务的基准测试的SAS基线的比较,这些基准测试并未充分评估这些优势。我们聚焦于自动生成的、旨在比手动设计的对应物具有更强泛化能力的MAS,针对SAS(特别是带自一致性的思维链,CoT-SC)进行了严格、系统的评估。在传统推理数据集和具有交互式多步骤工作流的任务(例如BrowseComp-Plus)上,我们证明自动MAS尽管成本高达CoT-SC的10倍,但其表现始终不如CoT-SC。为了将这些失败与任务结构的固有限制隔离开来,我们引入了一个专门为MAS设计的诊断合成数据集,该数据集具有明确的子任务分解、上下文分离和并行化潜力。我们表明,在此数据集上,专家设计的MAS在原始性能和成本效率方面始终优于自动生成的架构,这表明现有的评估框架未能考虑增加计算成本的边际效用,从而掩盖了复杂MAS的关键架构差距和低效。关键的是,对生成的MAS架构的系统解构表明,当前的自动化设计范式产生了架构臃肿,优先考虑表面的复杂性,这种复杂性并不能转化为功能效用,暴露了与多智能体基本原则的根本性错位。¹¹数据集和代码可在 https://multi-agent-eval.github.io/ 找到。 ## 1 引言 ![[无标题图片]](https://arxiv.org/html/2606.13003v1/img/plot_teaser_notitle.png) 图1: 多智能体优势的幻觉。理论承诺专业化(左);现实揭示冗余和功能崩溃(右)。自动化框架通常花费约10倍于CoT-SC的成本,带来可忽略的收益(第4节 (https://arxiv.org/html/2606.13003#S4))。 尽管大型语言模型(LLM)的能力已有显著提升,但作为单智能体系统(SAS),它们在诸如BrowseComp-Plus(Chen等人,2025 (https://arxiv.org/html/2606.13003#bib.bib66))和Humanity's Last Exam (HLE)(Phan等人,2025 (https://arxiv.org/html/2606.13003#bib.bib340))等复杂推理任务上仍显不足。多智能体系统(MAS)越来越多地被引入作为一种解决方案(Ke等人,2025a (https://arxiv.org/html/2606.13003#bib.bib208)),其假设是多个协调的LLM智能体通过任务分解、并行执行、上下文分离、角色专业化、辩论、协调和交叉验证等机制实现集体决策,从而胜过SAS(Foerster等人,2016 (https://arxiv.org/html/2606.13003#bib.bib121); Hernandez-Leal等人,2018 (https://arxiv.org/html/2606.13003#bib.bib166); Wang等人,2019 (https://arxiv.org/html/2606.13003#bib.bib474), 2024 (https://arxiv.org/html/2606.13003#bib.bib487); Zhou等人,2025 (https://arxiv.org/html/2606.13003#bib.bib616); Gao等人,2025 (https://arxiv.org/html/2606.13003#bib.bib130))。这一期望导致了**自动MAS**的快速发展,其特点是具有自动协调层,可以动态分解任务、配置智能体角色、路由信息和管理执行流程(Ke等人,2025b (https://arxiv.org/html/2606.13003#bib.bib207); Hu等人,2024 (https://arxiv.org/html/2606.13003#bib.bib174); Zhang等人,2025c (https://arxiv.org/html/2606.13003#bib.bib589); Liu等人,2024b (https://arxiv.org/html/2606.13003#bib.bib267); Zhang等人,2025a (https://arxiv.org/html/2606.13003#bib.bib598); Ke等人,2026 (https://arxiv.org/html/2606.13003#bib.bib209)),这与手动设计的MAS形成对比,后者依赖大量人工努力且通常缺乏对新颖任务的泛化能力。自动MAS也可以设计为去中心化的智能体团队系统,其中智能体更独立地进行通信和行动(Anthropic, 2026b (https://arxiv.org/html/2606.13003#bib.bib18); OpenClaw Agents, 2026 (https://arxiv.org/html/2606.13003#bib.bib328); MiroFish, 2026 (https://arxiv.org/html/2606.13003#bib.bib308))。尽管去中心化系统提供了替代的扩展特性,但集中式协调范式目前代表了高精度任务执行的标准,因此是我们评估的重点。 尽管很流行,但自动MAS的实际优势仍不明确。大多数评估将MAS与诸如思维链(CoT)(Wei等人,2022 (https://arxiv.org/html/2606.13003#bib.bib498))、带自一致性的思维链(CoT-SC)(Wang等人,2023 (https://arxiv.org/html/2606.13003#bib.bib478))或自我精炼(Madaan等人,2023 (https://arxiv.org/html/2606.13003#bib.bib295))等SAS基线进行比较,并报告在数学推理(Chen等人,2023 (https://arxiv.org/html/2606.13003#bib.bib55); Zhou等人,2025 (https://arxiv.org/html/2606.13003#bib.bib616); Ke等人,2025b (https://arxiv.org/html/2606.13003#bib.bib207); Hu等人,2024 (https://arxiv.org/html/2606.13003#bib.bib174); Liu等人,2024a (https://arxiv.org/html/2606.13003#bib.bib105); Zhang等人,2025c (https://arxiv.org/html/2606.13003#bib.bib589), a (https://arxiv.org/html/2606.13003#bib.bib598))、问答(QA)(Zhou等人,2025 (https://arxiv.org/html/2606.13003#bib.bib616); Ke等人,2025b (https://arxiv.org/html/2606.13003#bib.bib207); Hu等人,2024 (https://arxiv.org/html/2606.13003#bib.bib174); Liu等人,2024a (https://arxiv.org/html/2606.13003#bib.bib105); Zhang等人,2025c (https://arxiv.org/html/2606.13003#bib.bib589))和编码(Zhang等人,2025d (https://arxiv.org/html/2606.13003#bib.bib601); Chen等人,2023 (https://arxiv.org/html/2606.13003#bib.bib55); Zhou等人,2025 (https://arxiv.org/html/2606.13003#bib.bib616); Ke等人,2025b (https://arxiv.org/html/2606.13003#bib.bib207); Liu等人,2024a (https://arxiv.org/html/2606.13003#bib.bib105); Zhang等人,2025c (https://arxiv.org/html/2606.13003#bib.bib589), a (https://arxiv.org/html/2606.13003#bib.bib598))任务上的准确性提升。然而,这些比较很少控制推理预算,例如LLM调用次数、总成本、重试次数或采样路径。因此,MAS可能由于测试时计算量增加而非卓越的协调能力而显得更强(Kapoor等人,2024 (https://arxiv.org/html/2606.13003#bib.bib201); Anthropic, 2025 (https://arxiv.org/html/2606.13003#bib.bib16))。最近的研究进一步质疑了MAS的鲁棒性,显示其在强大的SAS基线面前表现不一致(Gao等人,2025 (https://arxiv.org/html/2606.13003#bib.bib130)),并且在辩论或验证机制中不稳定(Wynn等人,2025 (https://arxiv.org/html/2606.13003#bib.bib515); Venkataramani等人,2026 (https://arxiv.org/html/2606.13003#bib.bib461))。虽然有控制的分析表明收益取决于任务拓扑和成本(Kim等人,2025 (https://arxiv.org/html/2606.13003#bib.bib220); Ke等人,2026 (https://arxiv.org/html/2606.13003#bib.bib209)),但现有的评估侧重于结果准确性,而非作为动机的机制——如任务分解、并行化或上下文分离——是否真的在自动化工作流中体现出来。此外,Anthropic(Anthropic, 2026a (https://arxiv.org/html/2606.13003#bib.bib17))建议在上下文分离能提供明确益处的任务上构建MAS,例如:a)上下文保护,b)并行化,c)在领域、系统提示、工具集等方面的专业化。 尽管最近像MASBench(Ke等人,2026 (https://arxiv.org/html/2606.13003#bib.bib209))这样的数据集为分析MAS行为提供了受控框架,但大多数评估仍然依赖于最初为SAS设计的任务,这些任务未能隔离子任务结构、并行执行或角色专业化等特性。Kim等人(2025 (https://arxiv.org/html/2606.13003#bib.bib220))将常用的推理和QA基准测试(如GSM8K(Cobbe等人,2021 (https://arxiv.org/html/2606.13003#bib.bib72))和MMLU(Hendrycks等人,2021 (https://arxiv.org/html/2606.13003#bib.bib164)))归类为不适合评估智能体能力,因为它们评估的是静态推理,并将其与诸如BrowseComp-Plus(Chen等人,2025 (https://arxiv.org/html/2606.13003#bib.bib66))等需要动态和渐进式信息搜索与推理的基准测试进行对比。 为了解决当前MAS评估范式中的这种明显错位,我们的工作集中在三个主要调查方向上: 1. **比较性能**:自动MAS是否在一致且成本效益上优于强大的SAS基线? 2. **隔离任务适用性**:当提供明确的多智能体执行结构机会时,自动化协调器能否将其转化为功能效用? 3. **架构对齐**:自动化系统是否成功体现了核心MAS原则,如并行化、专业化和上下文保护? 我们通过系统评估自动MAS与强大的SAS基线(特别是CoT-SC)来测量**比较性能**。我们的评估跨越多种模型规模和系列,包括GPT-4o、GPT-5、GPT-OSS-120B和Gemini-2.5-Pro,并涵盖标准推理任务和更复杂的智能体设置,如GPQA-Diamond、HLE-Maths、SWE-Bench Lite和BrowseComp-Plus。我们发现自动MAS并未持续优于SAS;在许多设置中,CoT-SC匹配或超过MAS性能,同时更具成本效益。为了**隔离任务适用性**作为贡献因素,并研究MAS原则在有利条件下是否出现,我们引入了**合成多跳金融推理(SMFR)**数据集。SMFR具有明确的子任务结构、上下文密集型输入以及明确的并行化和专业化机会。我们再次发现CoT-SC在此任务上可靠地优于自动MAS,表明任务适用性并非其表现不佳的原因。我们还构建了一个专家设计的MAS基线,具有明确的分解、角色专业化和确定性协调。该基线表现强劲,表明当系统结构适当时,任务可以从MAS中受益。 我们进一步分析了生成MAS的**架构对齐**与核心MAS原则。我们对这些工作流的解构显示了**架构臃肿**和核心智能体功能中的系统性失败。具体而言:(i) 分配的智能体角色通常是功能冗余的;(ii) 许多自动MAS实际上崩溃为基本的CoT-SC执行;(iii) 关键是,这种缺乏专业化在不同任务中是一致的,暴露了自适应任务分解的根本缺陷。总之,我们的发现表明,自动MAS的感知优势往往是表面复杂性的副产品,而非结构协同。 我们的贡献包括: 1. **对MAS优势的关键重新评估**:我们通过系统基准测试证明,在考虑成本效益和基线强度时,自动MAS很少优于SAS基线。 2. **SMFR诊断基准**:我们引入了合成多跳金融推理,这是一个具有明确子结构的诊断任务,并提供了一个金标准 Expert-MAS 来建立MAS的经验性能上限。 3. **架构解构**:我们提供了对合成MAS工作流的严格分析,揭示了功能崩溃,即复杂的自动化设计在实践中退化为基本的单智能体执行。 ## 2 相关工作 虽然“智能体性”存在于一个连续统上(Kapoor等人,2024 (https://arxiv.org/html/2606.13003#bib.bib201)),我们根据推理的中心点来区分单智能体系统(SAS)和多智能体系统(MAS)。我们将SAS定义为由单个LLM实例控制的单一顺序控制循环,包括工具使用(Yao等人,2023 (https://arxiv.org/html/2606.13003#bib.bib547))、自我反思(Madaan等人,2024 (https://arxiv.org/html/2606.13003#bib.bib296))和CoT推理。相比之下,MAS具有多个基于LLM的智能体,通过结构化协议进行交互(Xi等人,2023 (https://arxiv.org/html/2606.13003#bib.bib516)),其行为源于集体推理。我们的工作特别评估了集中式、自动化的MAS,其中协调器动态管理角色和信息流,因为这些框架代表了当前智能体扩展的前沿。 **推理时自动MAS。** 这些MAS针对每个查询动态调整智能体配置。DyLAN(Liu等人,2024a (https://arxiv.org/html/2606.13003#bib.bib105))利用重要性评分动态选择子智能体,而MAS-Zero(Ke等人,2025b (https://arxiv.org/html/2606.13003#bib.bib207))尝试在无外部验证的情况下进行零样本协调。 **优化后的自动MAS。** 为了最小化测试时开销,这些框架在部署前发现或训练最优架构。ADAS(Hu等人,2025 (https://arxiv.org/html/2606.13003#bib.bib177))和AFlow(Zhang等人,2025c (https://arxiv.org/html/2606.13003#bib.bib589))将MAS设计视为代码生成任务,利用蒙特卡洛树搜索(MCTS)来寻找在验证集上表现良好的工作流。其他方法,如ToolOrchestra(Su等人,2025 (https://arxiv.org/html/2606.13003#bib.bib425))和MAS-Orchestra(Ke等人,2026 (https://arxiv.org/html/2606.13003#bib.bib209)),使用强化学习(RL)来训练集中式协调器。像MaAS(Zhang等人,2025a (https://arxiv.org/html/2606.13003#bib.bib598))这样的框架则处于中间地带;虽然底层操作符分布是预优化的,但系统通过实时采样依赖于查询的架构来进行推理时路由。我们评估这两种类型的系统,以确定动态灵活性或预优化的工作流是否能证明每个查询的显著计算开销是合理的,同时避免架构臃肿和功能崩溃。 **多智能体故障诊断。** Cemri等人(2025 (https://arxiv.org/html/2606.13003#bib.bib45))对执行级故障(例如通信故障)进行了分类,而我们诊断的是自动MAS搜索固有的结构低效(例如角色冗余、功能崩溃)。虽然Kapoor等人(2024 (https://arxiv.org/html/2606.13003#bib.bib201))和Kim等人(2025 (https://arxiv.org/html/2606.13003#bib.bib220))质疑基准测试对MAS的适用性,但我们引入SMFR作为诊断工具来隔离任务适用性。最后,针对Tran和Kiela(2026 (https://arxiv.org/html/2606.13003#bib.bib452))关于计算量混淆收益的批评,我们表明CoT-SC尽管使用了显著更低的token预算,仍持续优于MAS。这表明当前的自动化设计存在架构臃肿,未能将高支出转化为推理收益。 ## 3 对MAS优势的关键重新评估 为了探究自动MAS是否一致且成本有效地优于强大的S
相似文章
停止构建多智能体系统
一篇观点文章认为,向系统中添加更多智能体通常是解决可靠性问题的错误方法,而一个精心设计的、具有更好上下文、工具、护栏和评估的单一智能体通常更优。
多智能体系统与单智能体系统
本文指出,大多数所谓的“智能体化”系统实际上只是配备工具的单智能体,并强调了多智能体架构带来的高昂成本和复杂性。文章梳理了三种有效的多智能体模式——编排者-工作者、流水线以及点对点模式,并提供了判断何时采用多智能体而非单智能体的标准。
IP备忘录:多智能体("代理型")AI系统在编程、营销和创作中的应用 – 2026年全面分析。(整合可专利性、炒作与现实、人类依赖性及成本超支)
本综合分析评估了编程、营销和创作中的多智能体AI系统,认为尽管供应商大肆宣传其自主性和效率,但这些系统仍高度依赖人类输入,面临可专利性和版权限制,并在微软和Uber等主要科技公司导致成本超支,质疑其可持续价值。
我认为我们在AI代理上重蹈了早期微服务的覆辙
作者将早期的微服务热潮与当前的多智能体系统热潮进行了类比,认为工程实践——而非更好的模型——可能是实现可靠多智能体系统的关键。
@no_stp_on_snek: 如果你构建 multi-agent 或 mixture-of-agents 系统,请阅读 @dangerm00se 的文章。让我印象深刻的一个发现:甚至…
一位用户强调了 Hugh Madden 关于 multi-agent 系统的文章中的一个发现:即使是强大的仲裁者(GPT-5.5),如果先看到较弱代理的输出,也会产生偏差,从约 98% 的单独准确率下降到 7/9。