基础模型中的集体智能

arXiv cs.CL 论文

摘要

本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。

arXiv:2607.07729v1 公告类型:cross 摘要:随着基础模型在规模和多样性上的增长,将多个模型协调成协作推理系统为实现更安全、更可靠的AI提供了一条路径。本章提出了一个多智能体框架,其中求解器模型生成独立草稿,每个草稿经过批评智能体的结构化批评和修订,然后聚合智能体综合出最终共识解决方案。评分模块在所有智能体之间提供语义、数值和程序评估。通过在涵盖微积分、物理学、化学、生物学、经济学、优化、统计学和数学的基准上进行消融研究,我们分离了框架架构与模型多样性的贡献。我们比较了四种配置:(1) 单模型基线,(2) 使用一个共享模型的同质框架,(3) 使用同一模型的多个实例的冗余同质求解器,(4) 具有多样化专业模型的异构框架。结果表明,虽然框架结构和冗余采样带来适度改进,但模型异构性是驱动显著性能提升的关键因素。异构配置实现了更高的逐步准确性(0.64对比单模型的0.54;相比同质配置提升2.3倍),并在不同类别和难度级别上降低了方差。逐步推理质量(中间步骤的正确性,而不仅仅是最终答案)仅在模型多样性下显著提升,表明异构智能体提供了互补的错误检测和推理细化,这对于可解释性和可审计性至关重要。我们讨论了架构原则、评估方法以及对全球应用AI的影响,展示了异构多智能体协作如何支持在科学和工业领域中进行透明、可审计、高置信度的决策。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:19

# 基于基础模型的集体智能
来源:https://arxiv.org/html/2607.07729
\\tocauthor

de Curtò 等。

11institutetext:巴塞罗那超级计算中心科学与工程计算应用系,08034 巴塞罗那,西班牙
22institutetext:科米利亚斯教皇大学高等工程技术学院(ICAI),28015 马德里,西班牙
33institutetext:卢森堡科学技术研究所人本人工智能、数据与软件中心,L-4362 埃施-阿尔泽特,卢森堡

###### 摘要

随着基础模型的规模和多样性不断增长,将多个模型协调为合作推理系统,为实现更安全、全球更可靠的人工智能提供了一条有前景的路径。本章提出了一个多智能体推理框架,其中多个求解模型独立生成草稿,每个草稿由专门的批评智能体进行结构化批评和修订,并由一个更高级的聚合智能体综合出最终的共识解决方案。一个全面的评分模块对所有智能体进行语义、数值和过程评估。通过使用涵盖微积分、物理、化学、生物学、经济学、优化、统计学和数学的综合基准进行系统性的消融研究,我们分离了框架架构与模型多样性的不同贡献。我们比较了四种配置:(1) 无多智能体框架的个体基线,(2) 所有智能体使用相同模型的同质化框架,(3) 使用多个相同模型实例的冗余同质化解算器,以及 (4) 使用多样专业化模型的异质化框架。我们的结果表明,虽然框架结构和冗余采样带来了适度改进,但模型异质性成为驱动显著性能提升的关键因素。异质化配置在逐步准确性(个体模型平均为 0.64 对 0.54,且相比同质化配置提升 2.3 倍)上表现更优,且在不同问题类别和难度级别上的方差更低。值得注意的是,逐步推理质量(衡量中间推理步骤的正确性,而不仅仅是最终答案)仅在模型多样性下才显著提升,这表明异质化智能体提供了互补的错误检测和推理优化能力,这对于可解释性和可审计性至关重要。我们讨论了架构原则、评估方法以及对全球应用人工智能未来的启示,强调了异质化多智能体协作如何在科学和工业领域支持透明、可审计和高置信度的决策。

###### 关键词:

基础模型、多智能体系统、推理框架、大型语言模型、人工智能安全、共识机制。

## 1 引言

基础模型的快速发展从根本上改变了人工智能在多个领域的能力[3 (https://arxiv.org/html/2607.07729#bib.bib6)]。诸如 GPT-4[15 (https://arxiv.org/html/2607.07729#bib.bib7)]、Claude[1 (https://arxiv.org/html/2607.07729#bib.bib8)] 和 Llama[16 (https://arxiv.org/html/2607.07729#bib.bib9)] 等大型语言模型(LLMs)在自然语言理解、推理和生成任务中展现了卓越的能力。然而,个体模型存在固有的局限性,包括幻觉、推理错误、偏见以及跨问题领域的不一致表现[20 (https://arxiv.org/html/2607.07729#bib.bib10),11 (https://arxiv.org/html/2607.07729#bib.bib11)]。

多智能体系统代表了利用基础模型能力的一种有前景的范式转变[19 (https://arxiv.org/html/2607.07729#bib.bib12),10 (https://arxiv.org/html/2607.07729#bib.bib13),4 (https://arxiv.org/html/2607.07729#bib.bib3)]。多智能体架构并非依赖于单个模型的输出,而是允许多个模型协作、批评并综合解决方案[8 (https://arxiv.org/html/2607.07729#bib.bib14)]。这种方法提供了几个关键优势:

- •**错误缓解**:多个独立的推理路径降低了系统性错误传播到最终输出的概率。
- •**多元视角**:在不同数据集上训练的不同模型带来了互补的优势和推理方法。
- •**共识构建**:聚合机制可以识别高置信度的解决方案,同时标记出不确定或矛盾的输出。
- •**透明度**:来自多个智能体的显式推理步骤增强了可审计性和可解释性。

本文提出了一个模块化的多智能体推理框架,旨在利用异质化基础模型的集体智能。我们的架构包含四个主要组件:(1) 独立生成解决方案候选的**求解智能体**,(2) 识别逻辑缺陷并提出改进建议的**批评智能体**,(3) 从多个视角综合共识解决方案的**聚合智能体**,以及 (4) 同时评估语义连贯性和过程正确性的全面**评分模块**。

我们在一个涵盖八个科学学科(微积分、物理、化学、生物学、经济学、优化、统计学和数学)、并按难度级别分类的多样化基准上评估该框架。我们的实验采用了三个最先进的基础模型作为求解智能体:Meta-Llama-3.3-70B-Instruct、NousResearch Hermes-4-405B 和 Qwen3-235B-A22B-Instruct-2507。批评角色由 DeepSeek-R1-0528 承担,而 GPT-OSS-120B 作为聚合器。

本文的贡献有三方面:

1. 1.我们提出了一个模块化、可扩展的多智能体推理框架,通过结构化的批评和共识机制协调异质化的基础模型。
2. 2.我们通过实证表明,异质化的多智能体共识在逐步准确性上显著更优(0.641 对个体模型平均 0.533),并通过系统的消融研究展示了从单模型基线到同质化框架再到异质化智能体配置的渐进式改进。模型多样性是驱动推理质量提升的关键因素。
3. 3.我们提供了跨科学领域的性能特征综合分析,确定了协作的异质化推理在何处带来最大收益,以及何处仍存在挑战。

本章的其余部分组织如下:第2节 (https://arxiv.org/html/2607.07729#S2) 回顾了多智能体系统和基础模型推理的相关工作。第3节 (https://arxiv.org/html/2607.07729#S3) 详细介绍了我们的多智能体推理架构。第4节 (https://arxiv.org/html/2607.07729#S4) 描述了实验方法论和评估指标。第5节 (https://arxiv.org/html/2607.07729#S5) 呈现了全面的实验结果,而第6节 (https://arxiv.org/html/2607.07729#S6) 总结并指出了未来工作的方向。

## 2 相关工作

近年来,基础模型在数学、科学和常识推理等领域展现了令人印象深刻的推理能力[18 (https://arxiv.org/html/2607.07729#bib.bib15),12 (https://arxiv.org/html/2607.07729#bib.bib16),6 (https://arxiv.org/html/2607.07729#bib.bib4),7 (https://arxiv.org/html/2607.07729#bib.bib5)]。思维链提示[18 (https://arxiv.org/html/2607.07729#bib.bib15)] 使模型能够将复杂问题分解为中间推理步骤,显著提高了多步推理任务的性能。自洽性解码[17 (https://arxiv.org/html/2607.07729#bib.bib17)] 采样多个推理路径并选择最一致的答案,通过多样性有效减少错误。

然而,个体模型仍面临持续挑战。即使在最先进的系统中,幻觉问题依然存在[20 (https://arxiv.org/html/2607.07729#bib.bib10)],模型会生成看似合理但事实不正确的信息。推理错误可能会在涉及多个步骤的问题中累积[13 (https://arxiv.org/html/2607.07729#bib.bib18)],并且模型在不同知识领域表现出不同的优势[9 (https://arxiv.org/html/2607.07729#bib.bib19)]。

多智能体框架利用多个 LLM 实例协作解决复杂任务[19 (https://arxiv.org/html/2607.07729#bib.bib12),10 (https://arxiv.org/html/2607.07729#bib.bib13)]。AutoGen[19 (https://arxiv.org/html/2607.07729#bib.bib12)] 实现了对话式多智能体系统,其中不同角色的智能体通过交互来解决问题。MetaGPT[10 (https://arxiv.org/html/2607.07729#bib.bib13)] 在软件开发流程中为智能体分配特定角色,展示了结构化协作如何有效地分解复杂任务。

最近的研究探索了基于辩论的方法,其中多个模型进行结构化论证以优化输出[8 (https://arxiv.org/html/2607.07729#bib.bib14)]。思维社会框架[21 (https://arxiv.org/html/2607.07729#bib.bib20)] 创建了层级智能体结构,专门的子智能体为集体问题解决做出贡献。然而,这些方法通常缺乏显式的错误检测机制和对共识质量的量化评估。

自我优化技术使模型能够迭代地批评和改进自己的输出[14 (https://arxiv.org/html/2607.07729#bib.bib21)]。宪法性 AI[2 (https://arxiv.org/html/2607.07729#bib.bib22)] 训练模型根据指定原则评估和修订输出。然而,单模型的自我批评可能受到模型固有偏见和盲点的限制。

我们的框架通过引入一个具有不同模型架构和训练特征的专用批评智能体来扩展这些想法,提供了比单纯自我批评更多样化的错误检测能力。

## 3 多智能体推理框架

我们的模块化多智能体推理框架通过四个主要阶段协调多个基础模型:独立解决方案生成、自我批评与修订、共识聚合以及全面评分。图1 (https://arxiv.org/html/2607.07729#S3.F1) 展示了完整的架构。

![参见图注]图 1:模块化多智能体推理框架架构。该系统包含四个阶段:(1) 多个求解智能体独立生成候选解决方案;(2) 一个批评智能体识别逻辑缺陷并为每个求解器的最佳尝试提出改进建议;(3) 一个聚合智能体将所有修订后的解决方案综合为最终共识;(4) 一个评分器评估语义相似性、数值正确性和逐步过程准确性。该框架通过每个阶段的显式中间输出实现了透明、可审计的推理。

### 3.1 智能体配置

我们采用了被分配专门角色的异质化基础模型:

- •**求解智能体**:三个高性能模型独立生成候选解决方案:
    - – Meta-Llama-3.3-70B-Instruct(70B 参数)
    - – NousResearch Hermes-4-405B(405B 参数)
    - – Qwen3-235B-A22B-Instruct-2507(235B 活跃参数)
- •**批评智能体**:DeepSeek-R1-0528 执行错误检测和优化建议。选择此模型是因为其强大的分析能力以及与求解智能体不同的训练方法论。
- •**聚合智能体**:GPT-OSS-120B 将多个候选解决方案综合为一个统一的共识解决方案,协调差异并解释推理过程。

每个智能体都使用精心调整的参数:温度设为 0.2 以确保确定性推理,最大 token 限制为 500 词以输出简洁内容,并通过结构化提示确保输出格式一致。

每个求解智能体遵循标准协议,如算法1 (https://arxiv.org/html/2607.07729#alg1) 所述。

**算法1:求解智能体协议**
1: **输入**:问题描述 \(P\)
2: **输出**:解决方案候选 \(S_i\)
3:
4: 生成 \(N\) 个独立解决方案草案 \(\{D_1, D_2, \ldots, D_N\}\)
5: 计算每个草案的初步分数
6: 选择得分最高的最佳草案 \(D^*\)
7: **返回** \(D^*\) 作为解决方案候选 \(S_i\)

默认情况下,每个求解器为每个问题生成 \(N=3\) 个独立草案,通过采样引入多样性,同时保持计算效率。最佳草案基于初步的自我评估标准(包括推理步骤的完整性和最终答案的置信度)进行选择。

批评智能体,参见算法2 (https://arxiv.org/html/2607.07729#alg2),执行结构化的错误分析和优化:

**算法2:批评智能体协议**
1: **输入**:问题 \(P\),解决方案候选 \(S_i\)
2: **输出**:修订后的解决方案 \(S_i'\)
3:
4: 分析推理步骤的逻辑一致性
5: 识别计算错误或无效假设
6: 检查推理与最终答案之间的一致性
7: 生成包含错误解释的具体批评
8: 提出针对已识别问题的改进建议
9: 生成融入修复的修订解决方案 \(S_i'\)
10: **返回** \(S_i'\)

批评智能体被提示要建设性地批评,专注于实质性的逻辑和计算错误,而非风格偏好。这种单次批评提供了显著的错误纠正,同时避免了过多的计算开销。

聚合器从多个视角综合共识,如算法3 (https://arxiv.org/html/2607.07729#alg3) 所示。

**算法3:聚合智能体协议**
1: **输入**:问题 \(P\),修订后的解决方案 \(\{S_1', S_2', \ldots, S_k'\}\)
2: **输出**:共识解决方案 \(S_{\text{consensus}}\)
3:
4: 识别各解决方案之间的共识领域
5: 分析差异及其潜在原因
6: 评估每条推理路径的置信水平
7: 综合协调差异的统一解决方案
8: 解释推理过程和不确定性估计
9: **返回** \(S_{\text{consensus}}\)

聚合器被指示优先选择多个求解器支持的推理路径,同时对可能仍然正确的异常方法保持谨慎。当存在显著分歧时,聚合器明确承认不确定性,而不是强制达成人为共识。

### 3.2 评分与评估模块

我们采用了如 [5 (https://arxiv.org/html/2607.07729#bib.bib2)] 中介绍的综合多层面评分方法:

#### 语义相似性

使用句子变换器(all-MiniLM-L6-v2),我们计算模型生成的解决方案与参考解决方案在嵌入空间中的余弦相似性。这捕捉了概念对齐,而与具体措辞无关。

#### 数值正确性

我们使用正则表达式从模型和参考解决方案中提取数值,计算重叠率:

\[
\text{数值得分} = \frac{|\text{模型中的数值} \cap \text{参考中的数值}|}{|\text{参考中的数值}|} \tag{1}
\]

这确保了包含正确量化答案的解决方案即使解释文本不同,也能获得适当分数。

#### 总体得分

最终得分结合了语义和数值成分:

\[
\text{总体得分} = \frac{\text{语义相似性} + \text{数值得分}}{2} \tag{2}
\]

#### 逐步准确性

对于具有多步参考解决方案的问题,我们使用启发式模式匹配将模型输出分解为推理步骤。

相似文章