利用互补驱动的迭代协作发挥LLM群体的智慧
摘要
本文提出WILC,一个通过互补驱动的迭代协作来协调多个LLM的框架,在多个基准测试上展现出优于现有方法的性能,且估计成本比GPT-5.2更低。
大型语言模型(LLM)日益部署于企业环境,但单个模型仍受限于其特定能力边界。这些异构边界带来了部署挑战,同时也创造了机遇:通过策略性协调多个LLM,可能释放超越任何单一模型的集体智能。现有方法预先固定模型的组合方式,忽略了互补性在复杂问题解决中的动态、状态依赖作用。借鉴群体智慧范式,我们将LLM集体智能重新概念化为接力式互补:一个顺序过程,其中每个后继模型被选中用于解决其前驱输出中识别的特定瓶颈。为实现这一理念,我们提出WILC(LLM群体智慧集成),一个基于两项设计原则的框架。首先,迭代反思与细化建立了一个保留状态的工作流程,使模型能够诊断并细化先前的输出。其次,互补驱动的模型选择通过双门控机制控制转换:前瞻性互补适配(PCF)识别最适合当前瓶颈的工作者,而后验互补增益(PCG)评估所选转换是否改进了不断演化的解决方案。在四个多样化基准上的实验表明,WILC优于现有方法,包括单模型自我细化、集成方法和查询路由方法。在标准化定价假设下,WILC在估计每次查询成本约低7倍的情况下达到GPT-5.2的平均基准性能,同时通过自托管部署促进数据主权。本研究将群体智慧理论从静态聚合扩展到顺序AI互补,并为多AI协调提供了可迁移的设计原则。
查看缓存全文
缓存时间: 2026/08/03 07:30
# 通过互补性驱动的迭代协作发挥 LLM 群体的智慧 来源:https://arxiv.org/html/2607.29087 Yanbin Fang 香港中文大学商学院,中国上海 yibofang@link\.cuhk\.edu\.hk & Xuan Wei 上海交通大学安泰经济与管理学院,中国上海 weix@sjtu\.edu\.cn & Wei Chen 康涅狄格大学商学院,美国康涅狄格州斯坦福德 weichen@uconn\.edu ###### 摘要 大语言模型 \(LLMs\) 正越来越多地部署在企业环境中,以支持复杂的解决问题任务。然而,单个 LLM 仍受制于特定模型的能力边界。这些异构能力边界带来了部署挑战,但也创造了机遇:战略性地协调多个 LLM 可能释放出超过任何单个模型的集体智慧。现有方法预先确定模型的组合方式,忽视了互补性在复杂 LLM 问题解决中的动态和状态依赖性作用。借鉴群体智慧范式,我们将 LLM 集体智慧重新概念化为接力式互补性:一种顺序协调过程,其中每个后继模型被选择来解决其前任输出中识别出的特定瓶颈。为了将这种接力式互补性付诸实践,我们提出了 WILC(Wisdom Integration of LLM Crowds,LLM 群体智慧整合)框架,该框架基于两个设计原则。首先,迭代反思与改进建立了一种状态保持工作流,模型通过该工作流诊断并改进先前的输出。其次,互补性驱动的模型选择通过双门控机制管理模型转换:前瞻互补性匹配 \(PCF\) 识别最适合当前瓶颈的工作者,后验互补性增益 \(PCG\) 评估所选转换是否改进了不断发展的解决方案。这些设计原则共同支持通过能力互补性来优化答案的战略性模型转换。在四个多样化基准测试上的大量实验表明,WILC 在性能上优于现有方法,包括单模型自我改进、集成方法和专用查询路由方法。在标准化定价假设下,WILC 以约 7 倍更低的估算每查询成本实现了与 GPT-5.2 相当的平均基准性能,同时通过自托管部署促进数据主权。本研究通过将群体智慧理论从静态聚合扩展到顺序 AI 互补性,并为多 AI 协调提供可迁移的设计原则,为信息系统研究做出贡献。 *关键词* 大语言模型 ⋅\cdot 群体智慧 ⋅\cdot 能力互补性 ⋅\cdot 迭代改进 ⋅\cdot 计算设计科学 ⋅\cdot 上下文多臂老虎机 ## 1 引言 大语言模型 \(LLMs\) 已在广泛任务中展现出卓越性能,并越来越多地被企业采用。例如,企业利用 LLM 在内部支持员工解决运营或分析挑战,并通过对话或交互式应用将其部署在外部,为用户提供 LLM 驱动的服务(Haki et al.2025 (https://arxiv.org/html/2607.29087#bib.bib1),Raza et al.2025 (https://arxiv.org/html/2607.29087#bib.bib2))。然而,此类部署要求组织在众多能力差异显著的可用模型中进行选择。这种异构性源于训练数据、模型架构和训练技术的差异(Shnitzer et al.2023 (https://arxiv.org/html/2607.29087#bib.bib3),Lu et al.2024 (https://arxiv.org/html/2607.29087#bib.bib4))。即使前沿模型持续进步,其相对优势在不同任务类型上仍不均衡,而且针对给定问题的最佳模型往往难以事先知晓。这一问题在开源模型中尤为突出——考虑到数据隐私、成本效率和定制灵活性等战略因素,开源模型是私有企业部署的首选(AIMultiple2024 (https://arxiv.org/html/2607.29087#bib.bib5))。然而,这种异构性本身也提供了一个有前景的机遇:在不扩大模型参数规模的情况下增强 LLM 部署。具体而言,整合多个模型的互补优势可能释放集体智慧,并在问题解决性能上超越任何单个模型单独实现的效果。 整合多个 LLM(以下简称“LLM 群体智慧”)的目标与既有“群体智慧”范式一致,该范式关注聚合大量群体的判断,以实现优于任何单个成员甚至专家个体的集体绩效(Surowiecki2005 (https://arxiv.org/html/2607.29087#bib.bib6),Wei et al.2022a (https://arxiv.org/html/2607.29087#bib.bib7))。然而,当群体成员从人类转变为 LLM 时,问题的性质发生了根本性变化。 首先,就输出而言,LLM 产生非结构化输出,如自由文本、代码和推理链,而非传统群体设置中通常研究的可通约判断。这限制了传统统计聚合的直接应用(Atanasov et al.2017 (https://arxiv.org/html/2607.29087#bib.bib8),Wei et al.2025 (https://arxiv.org/html/2607.29087#bib.bib9)),尽管当输出可简化为标准化最终答案时,投票仍然可行。 其次,推理范式也有所不同。传统群体智慧依赖于独立且一次性的判断聚合(Becker et al.2022 (https://arxiv.org/html/2607.29087#bib.bib10),Thomas et al.2021 (https://arxiv.org/html/2607.29087#bib.bib11)),而 LLM 通常通过自回归解码运行,将问题解决转化为推理时计算的动态过程(Wei et al.2022b (https://arxiv.org/html/2607.29087#bib.bib12))。这种顺序生成使得分配额外的推理时资源来修改初始草稿变得自然;通过迭代改进机制(包括自我纠正和反思性批判),输出通常可以得到改进(Madaan et al.2023 (https://arxiv.org/html/2607.29087#bib.bib13),Shinn et al.2023 (https://arxiv.org/html/2607.29087#bib.bib14))。因此,LLM 群体创造了一个机会,不仅可以通过聚合已完成的输出来利用集体智慧,还可以在问题解决的演进过程中有意识地协调模型。 当前针对 LLM 群体智慧的方法大致可分为两类:(a) LLM 集成和 (b) 多智能体系统 \(MASs\)。LLM 集成通常通过基于模型能力将查询路由到最合适的模型(Shnitzer et al.2023 (https://arxiv.org/html/2607.29087#bib.bib3),Lu et al.2024 (https://arxiv.org/html/2607.29087#bib.bib4))或融合多个模型的输出来运作(Wang et al.2022 (https://arxiv.org/html/2607.29087#bib.bib15),Jiang et al.2023 (https://arxiv.org/html/2607.29087#bib.bib16))。相反,MAS 框架通过智能体的角色扮演以及使用预定义或自动生成的团队工作流来编排协作(Li et al.2024 (https://arxiv.org/html/2607.29087#bib.bib17),Guo et al.2024 (https://arxiv.org/html/2607.29087#bib.bib18))。尽管利用了多个(通常是异构的)模型,但这两类方法中的现有设计仍未实现深层、协同的能力互补性。在集成方法中,路由和融合通常要么在生成之前通过模型选择确定协作点,要么在生成之后通过输出融合确定协作点,因此它们对演进中的中间状态的访问有限。MAS 支持模型之间更丰富的交互,但其角色和工作流通常是预定义的,或在同一任务族内的查询之间复用,而非针对单个查询量身定制。尽管反思性机制(Shinn et al.2023 (https://arxiv.org/html/2607.29087#bib.bib14),Madaan et al.2023 (https://arxiv.org/html/2607.29087#bib.bib13))已经能够揭示解决方案的不足之处,但这两类方法都没有根据单个解决方案的实际发展来调整其协调方式。 为了超越这些能力边界并释放异构 LLM 群体的潜在智能,协调必须进入生成过程内部,这需要澄清:一旦问题解决以序列而非一组并行贡献的方式展开,互补性如何实现。互补性通常被定义为“不同但有用的品质”(Cambridge Dictionary2025 (https://arxiv.org/html/2607.29087#bib.bib19)),但其实现机制在静态判断任务和动态顺序推理任务之间有所不同。传统群体智慧设置通常通过静态聚合来组合并行判断(Surowiecki2005 (https://arxiv.org/html/2607.29087#bib.bib6),Yin et al.2021 (https://arxiv.org/html/2607.29087#bib.bib20),Wei et al.2025 (https://arxiv.org/html/2607.29087#bib.bib9))。相比之下,复杂 LLM 问题解决是路径依赖的:模型遇到的僵局反映了演进解决方案中的特定能力瓶颈。我们将利用这种中间瓶颈在生成过程中协调模型的概念称为接力式互补性。植根于异构模型之间的能力不对称性(Hemmer et al.2025 (https://arxiv.org/html/2607.29087#bib.bib21)),接力式互补性在后继模型能够专门解决前任模型的瓶颈并为演进中的解决方案带来非负边际改进(即互补性团队绩效)(Bansal et al.2021 (https://arxiv.org/html/2607.29087#bib.bib22))时得以实现。静态聚合与接力式互补性之间的这种区别通过图1 (https://arxiv.org/html/2607.29087#S1.F1) 中的示例加以说明,该图对比了两种机制如何分别处理一项混合任务:分析患者的临床记录,并使用 Python 代码计算个性化药物剂量。 图 1:激励示例:静态聚合 vs. 接力式互补性。参见图注说明。该任务同时需要医学知识和编码技能。左:静态聚合在生成后组合完整响应,当没有任何单个响应解决所有任务要求时,可能保留特定组件错误。右:WILC 通过先将任务分配给模型 A,然后利用其中间解决方案中识别出的瓶颈(语法错误)引导向模型 B 的转换,由模型 B 修正解决方案,从而实现接力式互补性。 为了将这种接力式互补性付诸实践,我们遵循设计科学范式(Hevner et al.2004 (https://arxiv.org/html/2607.29087#bib.bib23),Abbasi et al.2024 (https://arxiv.org/html/2607.29087#bib.bib24),Fang et al.2025 (https://arxiv.org/html/2607.29087#bib.bib25)),并提出了 WILC(Wisdom Integration of LLM Crowds,LLM 群体智慧整合),一种新颖的协作框架,将问题解决概念化为动态的、接力式的迭代反思与改进过程。基于能力异构性允许一个模型弥补另一个模型能力局限的洞察(Kamoi et al.2024 (https://arxiv.org/html/2607.29087#bib.bib26),He et al.2025 (https://arxiv.org/html/2607.29087#bib.bib27)),WILC 引入了一种战略性模型切换机制。当现任模型遇到挫折时,系统识别问题(以下简称“瓶颈”)的具体性质,并将不断演进的问题解决上下文传递给后继模型。其核心逻辑是最大化模型与瓶颈的匹配度,选择后继模型不仅是因为它在平均水平上更好,而是因为其特定的能力谱系与当前瓶颈相匹配。通过这种方式,每次模型转换都以当前解决方案状态为条件,而非仅由初始查询或预定义工作流决定。 为了在每一步接力中促进这种互补性的实现,WILC 采用了一种互补性验证机制来管理迭代。它沿两个维度运作:(a) 前瞻互补性匹配 \(PCF\),通过自适应上下文多臂老虎机算法(Li et al.2010 (https://arxiv.org/html/2607.29087#bib.bib28))识别最有可能解决当前瓶颈的模型;(b) 后验互补性增益 \(PCG\),评估所选模型是否保持或改进了不断发展的解决方案。通过将前瞻性选择与后验验证相结合,WILC 限制了无效的模型转换,并持续进行协作改进,直到群体的互补潜力耗尽或获得满意的答案。 为了验证 WILC 的有效性,我们在四个基准测试上使用多样化 LLM 群体进行了大量实验:代码生成、数学推理、通用知识推理和数据可视化。结果表明,WILC 有效协调了 LLM 群体的互补能力,并优于现有方法。重要的是,WILC 缓解了组织在多种可用模型中做出次优模型选择决策时面临的性能退化风险。消融实验验证了 WILC 框架内关键组件的贡献,值得注意的是,WILC 在每个基准-群体组合上都优于单模型自我反思,这表明其增益不能仅归结为迭代改进。此外,我们分析了 WILC 的 LLM 调用开销以评估其成本效益,结果表明,在我们分析中使用的标准化定价假设下,WILC 通过协调中等规模开源模型,以约 7 倍更低的估算每查询成本实现了与 GPT-5.2 相当的性能,同时通过自托管部署促进数据主权。 本文的其余部分组织如下:下一节回顾相关文献。然后,我们在第 3 节 (https://arxiv.org/html/2607.29087#S3) 详细阐述所提出的 WILC 框架,并在第 4 节 (https://arxiv.org/html/2607.29087#S4) 通过描述实验设计和展示实证结果来评估所提出的框架。最后,我们在第 5 节 (https://arxiv.org/html/2607.29087#S5) 总结贡献、启示、局限性和未来研究方向。 ## 2 相关工作 我们回顾三方面的研究:能力互补性(第 2.1 节 (https://arxiv.org/html/2607.29087#S2.SS1));通过集成和多智能体系统利用多个 LLM 智慧的方法(第 2.2 节 (https://arxiv.org/html/2607.29087#S2.SS2) 和第 2.3 节 (https://arxiv.org/html/2607.29087#S2.SS3));以及上下文多臂老虎机问题(第 2.4 节 (https://arxiv.org/html/2607.29087#S2.SS4)),它是我们设计的技术基础。 ### 2.1 协作中的互补性 互补性,通常定义为“结合时不同但有用的品质”(Cambridge Dictionary2025 (https://arxiv.org/html/2607.29087#bib.bib19)),是理解多样化实体如何超越任何单一实体单独行动的一个基石(Hemmer et al.2025 (https://arxiv.org/html/2607.29087#bib.bib21))。现有文献已从人机协作的角度探索了互补性,系统研究了利用互补性的概念化和方法论。
相似文章
互补智能体混合方法构建稳健的大语言模型集成
提出一个框架,用于在集成系统中选择互补的大语言模型作为提案者,将提案者选择重新表述为一个组合问题,并探索贪心算法以实现性能-成本的高效权衡。
LLM群体智慧:语言模型集成中的聚合与污染
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。
面向专业人类与大语言模型协作的能力条件化支架
介绍了能力条件化支架,一种用于大语言模型协作的框架,根据用户专业领域调整干预措施以防止专业领域漂移,并在MMLU子集上进行了试点评估。
CollabBench:通过主动参与与多样玩家基准测试并释放LLM协作能力
CollabBench是一个新的基准测试,用于评估和训练LLM智能体在合作游戏中的表现,具有多样玩家模拟和协作训练范式。实验表明,与基础模型相比,效率提高19.5%,情感性能提升24.4%。
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。