LLM群体智慧:语言模型集成中的聚合与污染
摘要
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。
arXiv:2607.18269v1 公告类型:新
摘要:群体智慧——即汇总多个个体的判断往往优于最佳个体的发现——已在人类预测者中得到广泛研究。当“群体”由大语言模型(LLM)组成时,是否会出现同样的现象,这是一个具有理论和实践意义的问题。我们针对254个二元预测市场问题,从15个LLM中获取了概率估计,并评估了经典与学习型聚合方法。学习型聚合器——多层感知机和逻辑回归——优于所有单个模型和经典方法。逻辑回归的性能与神经网络相当,表明学习型聚合的优势源于学习不同模型输出的线性组合,而非非线性交互。对神经网络学习到的映射应用符号回归,在帕累托前沿上恢复出纯模型分歧信号作为复杂度最低的有用公式,进一步支持了这一解释。训练截止期污染被证明是一个普遍存在的混淆因素:在子集上(所有模型训练截止期后解决的问题),前沿云模型与较小本地模型之间的明显能力差距从35.8%缩小到8.9%,且单个模型的排名仅表现出中等稳定性。即使在每个模型的训练截止期评估预测市场,LLM的准确性仍然显著较低,表明集体信息聚合存在真正的差距。这些发现表明,LLM群体可以表现出群体智慧效应,但无污染评估对于可靠评估至关重要。
查看缓存全文
缓存时间: 2026/07/22 08:21
# 大型语言模型群体的智慧:语言模型集成中的聚合与污染
来源:https://arxiv.org/html/2607.18269
###### 摘要
群体智慧(即聚合个体判断往往优于最佳个体表现这一发现)已在人类预测者中得到广泛研究。当“群体”由大型语言模型(LLMs)构成时,同一现象是否会出现,这是一个具有理论和实践意义的问题。我们从15个LLM中获取了254个二元预测市场问题的概率估计,并评估了经典聚合方法与学习型聚合方法。学习型聚合器——多层感知器与逻辑回归——在所有个体模型和经典方法中表现更优。研究发现逻辑回归与神经网络性能相当,表明学习型聚合的优势源于学习不同模型输出的线性组合,而非非线性交互作用。对神经网络学得映射的符号回归在帕累托前沿上恢复出一个纯粹的模型分歧信号作为最低复杂度的有用公式,进一步支持了这一解释。训练截止日期污染被证明是一种普遍存在的混淆因素:在问题解决时间均晚于所有模型训练截止日期的干净子集上,前沿云模型与较小本地模型之间的能力差距从35.8%骤降至8.9%,且个体模型排名仅显示出中等稳定性。即使在每个模型训练截止日期评估预测市场时,LLM的准确性仍然显著较低,表明集体信息聚合存在真正的差距。这些发现表明,LLM群体可以展现群体智慧效应,但无污染评估对于可靠评估至关重要。
关键词:群体智慧;集体智能;数据污染;集成方法;大型语言模型;概率聚合;符号回归
## 1 引言
群体智慧是指群体可能比其成员更聪明这一观念(Becker et al., 2019 (https://arxiv.org/html/2607.18269#bib.bib60)),这通常被理解为群体的聚合意见比其“普通成员”更准确(在某种意义上是这样;见下文),甚至比群体中“最佳”成员更准确。有充分证据支持前一种说法(Galton, 1907 (https://arxiv.org/html/2607.18269#bib.bib20); Surowiecki, 2004 (https://arxiv.org/html/2607.18269#bib.bib52); Davis-Stober et al., 2014 (https://arxiv.org/html/2607.18269#bib.bib10)),也有部分证据支持后一种说法(Hong and Page, 2004 (https://arxiv.org/html/2607.18269#bib.bib30); Page, 2007 (https://arxiv.org/html/2607.18269#bib.bib42); Prelec et al., 2017 (https://arxiv.org/html/2607.18269#bib.bib45); Douven, 2019 (https://arxiv.org/html/2607.18269#bib.bib14); Hong and Page, 2025 (https://arxiv.org/html/2607.18269#bib.bib31)),而这种群体智慧背后的机制至少在广义上也是明了的:个体预测者会犯部分独立的错误,而平均化可以抵消这些错误,同时保留共享信号(Larrick and Soll, 2006 (https://arxiv.org/html/2607.18269#bib.bib58))。基于这一见解,近期研究已识别出多种强大的聚合策略,这些策略专门利用误差分布的系统性特征(Douven et al., 2026 (https://arxiv.org/html/2607.18269#bib.bib18))。
随着大型语言模型(LLM)目前的广泛可用,自然会产生一个问题:LLM能否在群体智慧范式中替代人类预测者?¹¹如果可行,LLM群体可以为广泛任务提供廉价且可扩展的人类预测小组替代方案。此外,研究LLM群体可能进一步阐明群体智慧本身的机制:如果错误模式多样性驱动聚合收益,那么只要LLM的输出足够多样化——即使多样性程度以及由此产生的收益大小可能不同于人类群体(其成员带来了更多样化的背景和专业知识(Landemore, 2020 (https://arxiv.org/html/2607.18269#bib.bib35))),LLM群体也应受益于聚合。关键在于,如果多样性是关键要素,那么即使是根据模型历史一致性模式进行加权的简单学习型聚合器也可能足够——我们的结果将证实这一预测。
与我们最接近的现有工作是Schoenegger等人(2024 (https://arxiv.org/html/2607.18269#bib.bib54)),该研究使用了12个LLM群体对来自实时预测锦标赛的31个二元问题做出概率预测,发现LLM群体(通过简单中位数聚合)与925名人类预测者的群体在统计上不可区分。这是一个重要的概念验证,但它留下了一些重要问题未解答。首先,Schoenegger及其同事仅使用了非常简单的聚合方法(中位数),并未探究更复杂的聚合器是否能优于最佳个体模型或中位数本身。其次,他们没有解释任何聚合收益背后的机制——无论它反映的是错误模式多样性、性能加权组合还是其他因素。还应注意,由于他们实时收集关于未来事件的数据,污染在他们的研究中不是问题;我们的研究利用较长时间窗口内的已解决事件,面临更严重的污染挑战,需要明确处理(Carlini et al., 2021 (https://arxiv.org/html/2607.18269#bib.bib94); Roberts et al., 2024 (https://arxiv.org/html/2607.18269#bib.bib96); Xu et al., 2024 (https://arxiv.org/html/2607.18269#bib.bib93); Gao et al., 2025 (https://arxiv.org/html/2607.18269#bib.bib95))。²²
本研究旨在解决这些问题。我们从15个LLM(包括本地可部署的小型模型和前缘云模型)获取了254个二元预测市场问题的概率估计。我们评估了四种经典聚合方法,以及逻辑回归基线和训练好的多层感知器(MLP)聚合器,并应用符号回归来恢复MLP学习策略的可解释解释。我们还进行了系统性污染分析,检查训练截止日期重叠是否夸大了个体模型性能并扭曲了模型排名。
## 2 方法
### 2.1 材料
我们从Manifold Markets (https://manifold.markets/) 收集了二元(是/否)预测市场问题,这是一个娱乐货币预测平台,托管了关于时事、科学、技术和政治的广泛问题。³³问题选择标准为:解决时间在2024年6月至2026年3月之间,且吸引了至少75名独特交易者(该阈值旨在确保问题获得足够的社区关注)。将问题标题转换为陈述句后,⁴⁴排除了一部分因歧义、个人指代或依赖语言模型无法获取的内幕信息(例如:“解析为市场收盘时持有者最多的一方”;“我在2026年1月1日之前吸大麻”;“用铸铁锅做饭能让牛排更好吃吗?[Eloise的盲测]”)的问题。最终数据集包含208个陈述句,其中107个解决为真(是),101个解决为假(否)。市场收盘时的平均社区概率为0.53(SD=0.30)。
由于模型可能在其训练截止日期之前(我们15个模型中最新的训练截止日期是2025年8月;见表1 (https://arxiv.org/html/2607.18269#S2.T1))接受了包含问题结果的数据训练,我们定义了一个“干净子集”,由2025年9月1日之后解决的问题组成。主数据集208个项目中,有48个在此日期之后解决。为增加统计功效,我们补充了46个使用相同选择标准收集的、同样在2025年9月1日之后解决的Manifold Markets问题,最终得到94个项目的干净子集(44个是,50个否),用于鲁棒性分析,并将两个数据集中的总唯一项目数增至254个。来自初始208个项目的其余160个项目(2025年9月之前解决)用作在干净子集上评估的学习型聚合器的训练集(见第3节 (https://arxiv.org/html/2607.18269#S3))。
### 2.2 语言模型
表1:研究中包含的语言模型。训练截止日期为近似值,来自官方文档(如有)。云托管模型的规模未公开披露。我们从15个语言模型获取了概率估计,这些模型涵盖多种架构、规模和训练机制。五个模型通过Ollama本地运行;三个通过Anthropic API访问;三个通过OpenAI API访问;三个通过Google AI API访问;一个通过DeepSeek API访问。详细信息见表1 (https://arxiv.org/html/2607.18269#S2.T1)。⁵⁵因为我们还想分析模型能力如何影响聚合性能,所以同时包括了前缘云模型和较小的本地可部署模型。
### 2.3 引发程序
每个模型都呈现一个标准化提示,要求它估计给定陈述为真的概率,简要思考,并以“概率:[数字]”格式输出一个介于0和1之间的数字;示例见框2.3 (https://arxiv.org/html/2607.18269#S2.SS3)。所有模型通过各自的API(或本地模型通过Ollama)进行查询,max_tokens设为512,温度使用提供商默认值(所有情况下等同于1.0)。大多数模型可靠地遵循了提示格式。⁶⁶
框1:示例引发提示
您被要求评估以下陈述为真的概率。该陈述于2025-11-14进行评估。请使用此日期解释任何相对时间指代。
陈述:“到2026年1月底,‘末日之钟’将显示为距午夜60秒(或更少)。”
说明:
- 这是一个二元声明(要么为真,要么为假)。
- 请给出该陈述为真的概率,作为0到1之间的数字。
- 仅基于您的训练知识作答。请勿搜索互联网。
- 简要思考,然后在新的行中按以下确切格式陈述最终答案:
概率:[数字]
例如:概率:0.73
您的回应:
### 2.4 聚合方法
正如Douven等人(2026 (https://arxiv.org/html/2607.18269#bib.bib18))所论证的,群体中有多少智慧在很大程度上取决于我们如何聚合构成群体的个体的意见。遵循这些作者,我们评估了多种经典聚合方法以及一个训练好的神经网络聚合器。我们还研究了一个逻辑回归基线,并对神经网络学得的策略应用了符号回归。
#### 经典聚合器
所有四种经典方法都是广义f-均值族(Bullen, 2003 (https://arxiv.org/html/2607.18269#bib.bib64))的实例,该族将概率向量\((p_1,\ldots,p_N)\)通过下式映射为标量聚合:
\[M_f(p_1,\ldots,p_N) = f^{-1}\left(\frac{1}{N}\sum_{i=1}^N f(p_i)\right).\]
选择\(f\)为恒等函数得到“算术均值”,这可以说是最自然的基线;选择\(f\)为对数函数得到“几何均值”,需在结果间重新归一化使其和为1;选择\(f(x) = x^{-1}\)得到“调和均值”。最后,设置\(f = \text{logit}\)得到“对数几率均值”:
\[\sigma\left(\frac{1}{N}\sum_i \text{logit}(p_i)\right),\]
其中\(\sigma\)表示逻辑函数。对数几率均值被倡导为在个体判断条件独立且良好校准的假设下概率聚合的规范标准(Morris, 1983 (https://arxiv.org/html/2607.18269#bib.bib87); Genest and Zidek, 1986 (https://arxiv.org/html/2607.18269#bib.bib75); Douven et al., 2026 (https://arxiv.org/html/2607.18269#bib.bib18)),它对应于有时所谓的“极端化”算术均值(即相对于简单平均,将聚合结果推离0.5)。我们还纳入了“中位数”,它是Schoenegger等人(2024 (https://arxiv.org/html/2607.18269#bib.bib54))的主要聚合器,且比算术均值对异常值估计更鲁棒。
#### 神经网络聚合器(MLP)
我们遵循Douven等人(2026 (https://arxiv.org/html/2607.18269#bib.bib18))的做法,超越封闭形式的经典聚合器,训练一个多层感知器(MLP)直接从数据中学习聚合函数。该网络通过两个隐藏层将15维模型概率估计向量映射为单个聚合概率:输入层(15个单元)→ 隐藏层(64个单元,ReLU激活,dropout p=0.2)→ 隐藏层(32个单元,ReLU,dropout p=0.2)→ sigmoid输出层。网络使用Adam优化器(学习率\(5 \times 10^{-3}\))、二元交叉熵损失和批次大小16,训练25个周期。对于干净子集上的聚合分析(第2节结束?原文此处不完整,但根据上下文,后续内容应在翻译中继续,但用户提供的原文到2.4节为止?实际上用户提供的文本在2.4节中“For the aggregation analysis on the clean subset (Sect.2”处截断。但用户要求翻译给定内容,所以我们将按原文翻译至末尾。原文在2.4节中“For the aggregation analysis on the clean subset (Sect\.2\”处结束,没有完整句子。我们需按原文翻译,不添加内容。
注意:原文在2.4节末尾是“For the aggregation analysis on the clean subset (Sect\.2\”,明显不完整。但按照指令,我们忠实翻译原文。# 大型语言模型群体的智慧:语言模型集成中的聚合与污染
来源:https://arxiv.org/html/2607.18269
###### 摘要
群体智慧(即聚合个体判断往往优于最佳个体表现这一发现)已在人类预测者中得到广泛研究。当“群体”由大型语言模型(LLMs)构成时,同一现象是否出现,这是一个具有理论和实践意义的问题。我们从15个LLM中获取了254个二元预测市场问题的概率估计,并评估了经典聚合方法与学习型聚合方法。学习型聚合器——多层感知器与逻辑回归——在所有个体模型和经典方法中表现更优。研究发现逻辑回归与神经网络性能相当,表明学习型聚合的优势源于学习不同模型输出的线性组合,而非非线性交互作用。对神经网络学得映射的符号回归在帕累托前沿上恢复出一个纯粹的模型分歧信号作为最低复杂度的有用公式,进一步支持了这一解释。训练截止日期污染被证明是一种普遍存在的混淆因素:在问题解决时间均晚于所有模型训练截止日期的干净子集上,前沿云模型与较小本地模型之间的能力差距从35.8%骤降至8.9%,且个体模型排名仅显示出中等稳定性。即使在每个模型训练截止日期评估预测市场时,LLM的准确性仍然显著较低,表明集体信息聚合存在真正的差距。这些发现表明,LLM群体可以展现群体智慧效应,但无污染评估对于可靠评估至关重要。
关键词:群体智慧;集体智能;数据污染;集成方法;大型语言模型;概率聚合;符号回归
## 1 引言
群体智慧是指群体可能比其成员更聪明这一观念(Becker et al., 2019 (https://arxiv.org/html/2607.18269#bib.bib60)),这通常被理解为群体的聚合意见比其“普通成员”更准确(在某种意义上是这样;见下文),甚至比群体中“最佳”成员更准确。有充分证据支持前一种说法(Galton, 1907 (https://arxiv.org/html/2607.18269#bib.bib20); Surowiecki, 2004 (https://arxiv.org/html/2607.18269#bib.bib52); Davis-Stober et al., 2014 (https://arxiv.org/html/2607.18269#bib.bib10)),也有部分证据支持后一种说法(Hong and Page, 2004 (https://arxiv.org/html/2607.18269#bib.bib30); Page, 2007 (https://arxiv.org/html/2607.18269#bib.bib42); Prelec et al., 2017 (https://arxiv.org/html/2607.18269#bib.bib45); Douven, 2019 (https://arxiv.org/html/2607.18269#bib.bib14); Hong and Page, 2025 (https://arxiv.org/html/2607.18269#bib.bib31)),而这种群体智慧背后的机制至少在广义上也是明了的:个体预测者会犯部分独立的错误,而平均化可以抵消这些错误,同时保留共享信号(Larrick and Soll, 2006 (https://arxiv.org/html/2607.18269#bib.bib58))。基于这一见解,近期研究已识别出多种强大的聚合策略,这些策略专门利用误差分布的系统性特征(Douven et al., 2026 (https://arxiv.org/html/2607.18269#bib.bib18))。
随着大型语言模型(LLM)目前的广泛可用,自然会产生一个问题:LLM能否在群体智慧范式中替代人类预测者?¹¹如果可行,LLM群体可以为广泛任务提供廉价且可扩展的人类预测小组替代方案。此外,研究LLM群体可能进一步阐明群体智慧本身的机制:如果错误模式多样性驱动聚合收益,那么只要LLM的输出足够多样化——即使多样性程度以及由此产生的收益大小可能不同于人类群体(其成员带来了更多样化的背景和专业知识(Landemore, 2020 (https://arxiv.org/html/2607.18269#bib.bib35))),LLM群体也应受益于聚合。关键在于,如果多样性是关键要素,那么即使是根据模型历史一致性模式进行加权的简单学习型聚合器也可能足够——我们的结果将证实这一预测。
与我们最接近的现有工作是Schoenegger等人(2024 (https://arxiv.org/html/2607.18269#bib.bib54)),该研究使用了12个LLM群体对来自实时预测锦标赛的31个二元问题做出概率预测,发现LLM群体(通过简单中位数聚合)与925名人类预测者的群体在统计上不可区分。这是一个重要的概念验证,但它留下了一些重要问题未解答。首先,Schoenegger及其同事仅使用了非常简单的聚合方法(中位数),并未探究更复杂的聚合器是否能优于最佳个体模型或中位数本身。其次,他们没有解释任何聚合收益背后的机制——无论它反映的是错误模式多样性、性能加权组合还是其他因素。还应注意,由于他们实时收集关于未来事件的数据,污染在他们的研究中不是问题;我们的研究利用较长时间窗口内的已解决事件,面临更严重的污染挑战,需要明确处理(Carlini et al., 2021 (https://arxiv.org/html/2607.18269#bib.bib94); Roberts et al., 2024 (https://arxiv.org/html/2607.18269#bib.bib96); Xu et al., 2024 (https://arxiv.org/html/2607.18269#bib.bib93); Gao et al., 2025 (https://arxiv.org/html/2607.18269#bib.bib95))。²²
本研究旨在解决这些问题。我们从15个LLM(包括本地可部署的小型模型和前缘云模型)获取了254个二元预测市场问题的概率估计。我们评估了四种经典聚合方法,以及逻辑回归基线和训练好的多层感知器(MLP)聚合器,并应用符号回归来恢复MLP学习策略的可解释解释。我们还进行了系统性污染分析,检查训练截止日期重叠是否夸大了个体模型性能并扭曲了模型排名。
## 2 方法
### 2.1 材料
我们从Manifold Markets (https://manifold.markets/) 收集了二元(是/否)预测市场问题,这是一个娱乐货币预测平台,托管了关于时事、科学、技术和政治的广泛问题。³³问题选择标准为:解决时间在2024年6月至2026年3月之间,且吸引了至少75名独特交易者(该阈值旨在确保问题获得足够的社区关注)。将问题标题转换为陈述句后,⁴⁴排除了一部分因歧义、个人指代或依赖语言模型无法获取的内幕信息(例如:“解析为市场收盘时持有者最多的一方”;“我在2026年1月1日之前吸大麻”;“用铸铁锅做饭能让牛排更好吃吗?[Eloise的盲测]”)的问题。最终数据集包含208个陈述句,其中107个解决为真(是),101个解决为假(否)。市场收盘时的平均社区概率为0.53(SD=0.30)。
由于模型可能在其训练截止日期之前(我们15个模型中最新的训练截止日期是2025年8月;见表1 (https://arxiv.org/html/2607.18269#S2.T1))接受了包含问题结果的数据训练,我们定义了一个“干净子集”,由2025年9月1日之后解决的问题组成。主数据集208个项目中,有48个在此日期之后解决。为增加统计功效,我们补充了46个使用相同选择标准收集的、同样在2025年9月1日之后解决的Manifold Markets问题,最终得到94个项目的干净子集(44个是,50个否),用于鲁棒性分析,并将两个数据集中的总唯一项目数增至254个。来自初始208个项目的其余160个项目(2025年9月之前解决)用作在干净子集上评估的学习型聚合器的训练集(见第3节 (https://arxiv.org/html/2607.18269#S3))。
### 2.2 语言模型
表1:研究中包含的语言模型。训练截止日期为近似值,来自官方文档(如有)。云托管模型的规模未公开披露。我们从15个语言模型获取了概率估计,这些模型涵盖多种架构、规模和训练机制。五个模型通过Ollama本地运行;三个通过Anthropic API访问;三个通过OpenAI API访问;三个通过Google AI API访问;一个通过DeepSeek API访问。详细信息见表1 (https://arxiv.org/html/2607.18269#S2.T1)。⁵⁵因为我们还想分析模型能力如何影响聚合性能,所以同时包括了前缘云模型和较小的本地可部署模型。
### 2.3 引发程序
每个模型都呈现一个标准化提示,要求它估计给定陈述为真的概率,简要思考,并以“概率:[数字]”格式输出一个介于0和1之间的数字;示例见框2.3 (https://arxiv.org/html/2607.18269#S2.SS3)。所有模型通过各自的API(或本地模型通过Ollama)进行查询,max_tokens设为512,温度使用提供商默认值(所有情况下等同于1.0)。大多数模型可靠地遵循了提示格式。⁶⁶
框1:示例引发提示
您被要求评估以下陈述为真的概率。该陈述于2025-11-14进行评估。请使用此日期解释任何相对时间指代。
陈述:“到2026年1月底,‘末日之钟’将显示为距午夜60秒(或更少)。”
说明:
- 这是一个二元声明(要么为真,要么为假)。
- 请给出该陈述为真的概率,作为0到1之间的数字。
- 仅基于您的训练知识作答。请勿搜索互联网。
- 简要思考,然后在新的行中按以下确切格式陈述最终答案:
概率:[数字]
例如:概率:0.73
您的回应:
### 2.4 聚合方法
正如Douven等人(2026 (https://arxiv.org/html/2607.18269#bib.bib18))所论证的,群体中有多少智慧在很大程度上取决于我们如何聚合构成群体的个体的意见。遵循这些作者,我们评估了多种经典聚合方法以及一个训练好的神经网络聚合器。我们还研究了一个逻辑回归基线,并对神经网络学得的策略应用了符号回归。
#### 经典聚合器
所有四种经典方法都是广义f-均值族(Bullen, 2003 (https://arxiv.org/html/2607.18269#bib.bib64))的实例,该族将概率向量\((p_1,\ldots,p_N)\)通过下式映射为标量聚合:
\[M_f(p_1,\ldots,p_N) = f^{-1}\left(\frac{1}{N}\sum_{i=1}^N f(p_i)\right).\]
选择\(f\)为恒等函数得到“算术均值”,这可以说是最自然的基线;选择\(f\)为对数函数得到“几何均值”,需在结果间重新归一化使其和为1;选择\(f(x) = x^{-1}\)得到“调和均值”。最后,设置\(f = \text{logit}\)得到“对数几率均值”:
\[\sigma\left(\frac{1}{N}\sum_i \text{logit}(p_i)\right),\]
其中\(\sigma\)表示逻辑函数。对数几率均值被倡导为在个体判断条件独立且良好校准的假设下概率聚合的规范标准(Morris, 1983 (https://arxiv.org/html/2607.18269#bib.bib87); Genest and Zidek, 1986 (https://arxiv.org/html/2607.18269#bib.bib75); Douven et al., 2026 (https://arxiv.org/html/2607.18269#bib.bib18)),它对应于有时所谓的“极端化”算术均值(即相对于简单平均,将聚合结果推离0.5)。我们还纳入了“中位数”,它是Schoenegger等人(2024 (https://arxiv.org/html/2607.18269#bib.bib54))的主要聚合器,且比算术均值对异常值估计更鲁棒。
#### 神经网络聚合器(MLP)
我们遵循Douven等人(2026 (https://arxiv.org/html/2607.18269#bib.bib18))的做法,超越封闭形式的经典聚合器,训练一个多层感知器(MLP)直接从数据中学习聚合函数。该网络通过两个隐藏层将15维模型概率估计向量映射为单个聚合概率:输入层(15个单元)→ 隐藏层(64个单元,ReLU激活,dropout p=0.2)→ 隐藏层(32个单元,ReLU,dropout p=0.2)→ sigmoid输出层。网络使用Adam优化器(学习率\(5 \times 10^{-3}\))、二元交叉熵损失和批次大小16,训练25个周期。对于干净子集上的聚合分析(第2节相似文章
(AI)群体的智慧:探究大型语言模型中的人工群体智能
本文探究了大型语言模型是否能够通过模型内和模型间的聚合来近似群体智能效应,发现在八项估计任务中,平均绝对百分比误差(MAPE)显著降低高达37个百分点。
基于推理的多样性:利用LLM群体的智慧进行未来预测
本文提出了一种行为感知框架,用于构建多样化的LLM群体以改进未来预测,表明行为多样化的较小群体可以超越较大的群体,同时降低推理成本。
分区、提示、聚合:语言模型中的统计自一致性
本文提出了一个框架来测试LLM估计是否在不同子群体间遵循统计自一致性(全概率定理),发现了广泛的违反以及“宏观谬误”,即细粒度估计与人类数据的一致性更好。
大型语言模型能否对检索到的信息保持审慎态度?
本文研究了大型语言模型如何适应检索信息的确定程度,指出了其在处理不确定性方面的系统性局限。论文提出了一种交互策略,在不修改模型权重的前提下,将顺从错误降低了 25%。
一致但校准不佳:评估LLM在自然语言风险沟通中的局限性
本文评估了九个LLM在自然语言中准确传达概率预测的能力,发现模型表现一致但校准不佳,尤其是在不确定性任务上。