(AI)群体的智慧:探究大型语言模型中的人工群体智能
摘要
本文探究了大型语言模型是否能够通过模型内和模型间的聚合来近似群体智能效应,发现在八项估计任务中,平均绝对百分比误差(MAPE)显著降低高达37个百分点。
arXiv:2606.31404v1 公告类型:新
摘要:人类群体智能展现出卓越的集体准确性,但在成本、协调和时间方面面临可扩展性限制。我们探究大型语言模型(LLM)是否能够通过人工群体来近似群体智能效应,弥补了理解基于AI的聚合机制方面的关键空白。我们进行了一项受控实验,包含960个手动执行的提示,涉及三个专有模型(GPT-5、Gemini 2.5 Pro、Claude Sonnet 4.5),在八项估计任务上测试了模型内采样和模型间聚合。结果显示,通过模型内和模型间聚合,误差持续降低,在不同聚合策略下MAPE显著降低高达37个百分点。我们观察到相对置信区间宽度与相对估计误差之间呈正相关,效应量从小到较大(Spearman的$\rho=0.242-0.568$,所有$p<0.001$),表明LLM在评估不确定性时具有元认知意识。我们讨论了对研究和实践的影响,为在组织决策中部署LLM群体提供了可操作的见解。
查看缓存全文
缓存时间: 2026/07/01 05:38
# (AI)群体智慧:探究大型语言模型中的群体智能模拟 来源:https://arxiv.org/abs/2606.31404 查看PDF (https://arxiv.org/pdf/2606.31404) > **摘要:**人类群体智能展现出卓越的集体准确性,但在成本、协调和时间方面面临可扩展性瓶颈。本研究探究大型语言模型(LLMs)能否通过人工群体来近似实现群体智能效应,从而填补理解基于AI的聚合机制的关键空白。我们开展了一项受控实验,涉及960个手动执行的提示词,涵盖三种专有模型(GPT-5、Gemini 2.5 Pro、Claude Sonnet 4.5),并在八项估计任务上测试了模型内采样和模型间聚合策略。结果表明,通过模型内和模型间聚合,误差持续降低;在不同聚合策略下,平均绝对百分比误差(MAPE)显著下降,降幅最高达37个百分点。我们观察到相对置信区间宽度与相对估计误差之间存在小到大的正相关效应量(Spearman's ρ=0.242–0.568,所有p<0.001),这表明LLMs在评估不确定性时具备元认知意识。我们讨论了该发现对研究和实践的启示,为在组织决策中部署LLM群体提供了可操作的见解。 ## 提交历史 来自:Justin Brenne [查看邮箱](https://arxiv.org/show-email/9f59cc5b/2606.31404) **[v1]** 2026年6月30日星期二 09:30:53 UTC(549 KB)
相似文章
LLM群体智慧:语言模型集成中的聚合与污染
本文研究了将多个LLM的概率估计进行聚合是否会产生群体智慧效应,发现学习型聚合器优于单个模型,并且训练截止期污染是此类评估中普遍存在的混淆因素。
AI能猜出你知道什么吗?基于通信日志的人类领域知识估算中大语言模型的性能比较
本文研究了大语言模型是否能够从长期Slack日志中推断个人领域知识,比较了七种模型,发现Gemini 2.5 Flash误差最低,揭示了自动专家知识映射的可行性与局限性。
人工智能模型能够预测并协同调节人类记忆搜索
本研究探讨了大型语言模型如何预测和增强人类语义记忆搜索,表明LLMs能够比其他人类更好地跟踪人类思维轨迹,并通过协作互动改善人类记忆处理。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
网络上的大型语言模型:资源受限下的协作智能
本文探讨了分布式大型语言模型(LLMs)如何在设备和云端之间协同工作以应对资源限制的协作智能范式。文章涵盖了垂直方向的设备-云端协作、水平方向的多智能体协作、路由策略,以及在可扩展且可信的协作式人工智能方面的开放研究挑战。