基于推理的多样性:利用LLM群体的智慧进行未来预测
摘要
本文提出了一种行为感知框架,用于构建多样化的LLM群体以改进未来预测,表明行为多样化的较小群体可以超越较大的群体,同时降低推理成本。
arXiv:2608.24001v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地用于未来预测,这促使使用多个模型作为群体智慧机制。然而,仅仅增加群体规模并不能保证有效的多样性,因为不同的LLMs可能表现出冗余行为。我们提出了一种行为感知框架,用于构建多样化的LLM群体。该框架使用模型在独立开发任务上的推理轨迹来表征模型,根据行为相似性对模型进行聚类,并选择代表进行集体预测。我们使用七个开发基准测试评估了25个LLMs,以进行行为多样性建模,并使用两个未来预测基准测试评估多样化群体的性能。结果显示,群体组成可能比群体规模更重要:基于K-means++行为聚类的三模型中心群体在两个预测基准测试中都优于所有25个模型的传统投票,同时减少了88%的模型调用和约80%的推理成本。结果进一步表明,代表性行为多样性,而非简单地最大化多样性,对于构建有效的LLM群体很重要
查看缓存全文
缓存时间: 2026/08/26 09:19
# 利用大语言模型群体智慧进行未来预测
来源:https://arxiv.org/html/2608.24001
## 基于推理多样性:利用大语言模型群体智慧进行未来预测
**致谢:** *前三位作者贡献均等*
Nirupam Chetlapalli∗, Yiming Liao∗, Min-Chun Chen∗, Keke Chen
**单位:** 马里兰大学巴尔的摩分校计算机科学与电气工程系
美国马里兰州巴尔的摩市
\{nchetla1, yliao1, mchen12, kekechen\}@umbc.edu
###### 摘要
大语言模型(LLMs)越来越多地被用于未来预测,这促使人们采用多模型作为群体智慧机制。然而,单纯增加群体规模并不一定能保证有效多样性,因为不同的LLMs可能表现出冗余行为。我们提出了一种构建多样化LLM群体的行为感知框架。该框架通过模型在独立开发任务上的推理轨迹来刻画模型特征,根据行为相似性对模型进行聚类,并选择代表性模型进行集体预测。我们使用七个开发基准测试评估了25个LLMs的行为多样性建模能力,并使用两个未来预测基准测试评估了多样化群体的性能。结果表明,群体构成比群体规模更重要:基于KK-means++行为聚类的三模型中心点群体在两个预测基准测试中均优于对全部25个模型进行的传统投票方法,同时减少了88%的模型调用次数和约80%的推理成本。结果进一步表明,代表性行为多样性而非简单最大化多样性,对于构建有效的LLM群体至关重要。源代码和数据集将公开发布。
---
## I 引言
大语言模型(LLMs)正越来越多地被探索用于预测不确定的未来事件\[1\]\[2\],近期的基准测试系统性地评估了它们的预测能力\[3\]\[4\]\[5\]。尽管取得了这些进展,未来预测本质上仍具有不确定性,且单个LLMs的预测结果可能存在显著差异。因此,一个自然的替代方案是将多个LLMs聚合成一个预测者群体。经典的群体智慧文献表明,集体判断可以超越个体决策者,但也强调群体构成——尤其是多样性和独立性——至关重要\[6\]\[7\]\[8\]。精心构建的小型群体甚至可以超越大得多的群体\[9\]\[10\]。近期研究也展示了LLMs之间集体智能的潜力\[11\]\[12\]。然而,简单地将不同的LLMs组合在一起并不能保证形成一个真正多样化的群体。行为相似的模型可能贡献冗余的判断,而传统的多数投票却赋予每个模型平等的投票权。这引出了一个与现有LLMs聚合工作互补的问题\[13\]\[14\]:*究竟应该由哪些模型来构成这个群体?*一个包含大量行为相似模型的大型群体可能会过度代表特定视角,同时产生不必要的推理成本。相反,一个保留了不同行为视角的小型群体可能会产生更有效的集体预测。因此我们提出:
> *我们能否通过显式考虑行为多样性,而非仅仅增加投票者数量,来构建一个更智慧的LLM群体?*
我们通过一种行为驱动的方法来解决这个问题。我们不从模型系列、提供商或其他元数据推断多样性,而是观察LLMs如何推理一组共同的、异构的开发任务。我们将它们的推理轨迹嵌入并聚合成模型级的*行为特征*,然后对这些特征进行聚类以识别表现出相似行为的模型组。重要的是,这些特征完全基于独立于未来预测基准的开发任务构建。我们利用发现的结构,通过代表性中心点、面向多样性的选择和集群级投票来构建群体。这种设计使我们能够检验有效的群体构建是否需要最大化行为多样性,或者是否需要对不同行为模式进行代表性覆盖。
我们使用来自七个异构开发基准的350个问题和两个独立的未来预测基准(FutureX-Past\[5\]和Bench to the Future\[4\])评估了25个LLMs。结果表明,群体构成可能比群体规模更重要。一个基于KK-means++行为聚类中心点代表构建的三模型群体,在两个预测基准上都优于对全部25个模型进行的传统投票方法,同时减少了88%的模型调用次数和约80%的推理成本。规模匹配的随机群体实验进一步支持了行为感知选择的益处。相反,最大化行为差异并不能持续改进预测,这表明*代表性行为多样性*而非单纯的多样性,对于构建有效的LLM群体至关重要。
本文的主要贡献包括:
- 将LLM未来预测表述为一个群体构建问题,并指出行为冗余是传统多数投票的局限性。
- 开发了一个行为感知框架,通过独立任务上的推理轨迹刻画LLMs的多样性,并利用生成的结构构建代表性群体。
- 在25个LLMs和两个未来预测基准上,展示了一个三模型行为感知群体在减少88%的模型调用次数和约80%的推理成本的同时,优于传统的25模型投票方法。
---
## II 相关工作
**群体智慧**
群体智慧文献表明,当群体提供足够多样且独立的信息时,聚合多个判断可以超越个体决策者\[6\]。重要的是,更大的群体不一定更好:群体构成可以被优化,精心选择的小型群体可以匹配或超越规模大得多的群体\[7\]\[8\]\[9\]。这促使我们将群体构成——而不仅仅是群体规模——视为一个设计问题。与我们工作特别相关的是,Bhatt等人\[10\]从可观察的行为推断参与者的多样性,据此对参与者进行聚类,并选择代表来构建更小的群体。我们的工作将这种行为驱动的观点扩展到了LLMs:我们不使用参与者生成的社交内容,而是通过模型在异构任务上的推理行为来刻画它们,并检验由此生成的结构能否指导未来预测的群体构建。
**使用LLMs进行集体决策**
近期研究展示了LLMs之间集体智能的多种形式。自我一致性聚合了单个模型的多个推理轨迹\[15\],而异构LLM集成则可以通过跨模型聚合来改进预测和估计\[11\]\[12\]。其他方法引入了模型间的交互,如多智能体辩论\[16\]和混合智能体\[17\]。近期研究还重新思考了如何组合异构的模型判断,包括替代的选举机制\[13\]以及考虑高阶信息的聚合规则\[14\]。这些研究主要改进了如何采样、组合或交换多个模型的输出。我们的关注点与之互补:我们研究*群体构建*。我们不假设不同的模型身份构成一个多样化群体,而是从推理轨迹中测量行为多样性,并利用生成的结构来决定哪些模型应该代表这个群体。
**LLM未来预测基准**
LLM预测已从早期基准(如Autocast\[1\])发展到接近人类预测性能的系统\[2\]。更新的基准通过不同的评估设计来解决时间污染和现实的未来预测问题。ForecastBench维护动态生成的未解决预测问题\[3\],Bench to the Future使用基于时期正确信息的回溯预测\[4\],而FutureX则提供了一个持续更新的基准,用于评估LLMs和智能体的未来预测能力\[5\]。这些基准将未来预测确立为LLMs的一种可度量的能力,但主要评估单个系统。我们的工作则利用未来预测基准来研究一个不同的问题:独立于预测任务获得的行为信息是否可用于构建一个更小、更有效的LLM预测者群体。
---
## III 方法
我们的目标是构建一个LLM群体,该群体能够捕捉不同的行为视角,而不是简单地包含尽可能多的模型。传统的多数投票将模型视为同等信息量的投票者,尽管它们的预测和问题解决行为可能高度冗余。这可能导致大量行为相似的模型在集体决策中占据主导地位,同时贡献的附加信息有限。因此,我们构建了一个*行为感知的多样化LLM群体*。关键思想是从模型在共同开发任务上的行为方式推断多样性,而非基于元数据(如模型系列、提供商或参数数量)。这遵循了从可观察行为推断群体多样性的普遍原则\[10\],但将其应用于LLMs在受控任务上的推理行为。生成的行为结构随后用于选择代表性投票者或将模型组织成子委员会。
该框架包含三个阶段:(1) 行为表征,(2) 行为聚类与群体构建,以及 (3) 预测聚合。重要的是,用于刻画行为的开发问题与用于评估的未来预测问题是分开的。因此,群体的构建没有使用评估问题的标签。
---
### III-A 基于推理的行为表征
一个核心设计问题是如何定义LLMs之间的多样性。模型身份提供了一个方便的代理指标,但来自不同系列的模型可能表现相似,而同一系列内的模型可能表现出不同的问题解决模式。因此,我们直接从可观察的模型行为来刻画多样性。给定一组共同的 \(T\) 个开发问题,每个模型 \(M_j\) 为问题 \(q_i\) 生成一个推理轨迹 \(r_{ij}\)。文本编码器 \(E(\cdot)\) 将每个轨迹映射到一个向量,然后进行归一化以消除嵌入量纲差异。我们通过其推理嵌入的归一化平均值来概括模型 \(M_j\):
\[
\mathbf{b}_j = \operatorname{Norm}\left(\frac{1}{T} \sum_{i=1}^T \operatorname{Norm}\big(E(r_{ij})\big)\right),
\]
其中 \(\operatorname{Norm}(\mathbf{x}) = \mathbf{x}/\|\mathbf{x}\|_2\)。我们将 \(\mathbf{b}_j\) 称为该模型的*行为特征*。由于向量源于文本数据,余弦相似性通常是更好的相似性度量,因此长度归一化有助于计算这些特征之间的余弦相似度。这种表征方式特意保持简单。在大量异构问题上取平均值,强调的是跨任务持续存在的行为模式,而非对个别问题的特异性响应。归一化进一步防止了长或高幅度的嵌入不成比例地影响特征。同时,该特征应被理解为*可观察推理行为*的表征,而非对其内部推理过程的忠实描述。这种设计也不同于仅通过最终预测来刻画LLM群体的方法。例如,近期的聚合方法显式地考虑了模型答案之间的异质性或相关性\[14\]。我们的目标是在下游预测任务*之前*获取一个行为信号,并检验该信号是否可用于构建群体本身。
---
### III-B 发现行为结构
我们使用行为特征来识别表现出相似推理行为的模型组。聚类服务于一个操作性目的:它近似于模型群体中不同的行为模式,使得一大群相似的模型无需在最终群体中获得成比例的更高代表性。我们不将聚类解释为LLMs内在或普遍的“类型”。我们使用轮廓系数\[18\]确定候选聚类数量 \(K\),并考察两种互补的聚类方法:KK-means++和凝聚层次聚类。KK-means++提供基于中心点的划分,而层次聚类不依赖于中心点初始化,并提供了行为结构的互补视角。使用两种方法也使我们能够评估下游群体性能是否强烈依赖于特定的聚类假设。
此聚类阶段将我们的方法与近期主要通过集体决策规则引入多样性的工作区分开来。例如,Zhao等人\[13\]通过替代选举机制使多智能体决策多样化。相比之下,我们保留了简单的聚合规则,并根据独立于预测任务观察到的行为来修改*群体的构成*。
---
### III-C 行为感知的群体构建
给定行为聚类 \(C_1, \ldots, C_K\),我们考虑三种策略,它们代表了对有用群体多样性的不同解释。
#### III-C1 中心点代表
第一种策略从每个行为聚类中选择一个代表。对于聚类 \(C_c\),我们选择其中心点:
\[
M_c^{\mathrm{med}} = \arg\min_{M_i \in C_c} \sum_{M_j \in C_c} d(M_i, M_j),
\]
其中 \(d(\cdot,\cdot)\) 是基于特征的行为距离。中心点是一个实际的LLM,其观察到的行为特征在该聚类内与其他模型的平均距离最小。这种方法确保每个行为模式都得到代表,无论其模型数量多少。相似文章
LLM群体智慧:语言模型集成中的聚合与污染
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。
BODHI:LLM是否会分支并发现异质推理?
本文研究了经过RLVR训练的LLM是否会分支以发现异质推理,通过迷宫求解实验和BODHI-Trees表明,策略熵坍缩伴随着语义分支熵的减少,从而限制了展开(rollout)的多样性。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
推理还是记忆?LLM强化学习中的方向感知多样性探索
本文介绍了DiRL,一种方向感知的强化学习框架,能够在LLM探索中区分推理驱动的多样性和记忆驱动的多样性。它从模型表示中提取内在的推理-记忆方向,并塑造奖励以优先考虑与推理一致的探索,在数学和通用推理基准上表现出改进。
提示引导的多样化策略优化用于LLM推理
本文介绍了提示引导的多样化策略优化(HDPO),这是一个两阶段强化学习框架,鼓励LLMs首先生成多个候选解决方案大纲(提示),然后选择最可靠的一个进行详细推理,从而提升推理的多样性和可靠性。