思维经济:通过经济互动涌现的多智能体智能
摘要
本文介绍了一种面向多智能体AI系统的经济框架,其中智能体通过经济机制互动以产生涌现的集体智能,灵感来自哈佛和麻省理工学院的研究人员。
arXiv:2606.02859v1 公告类型:新
摘要:一群智能体如何在无集中控制的情况下自我协调和自我适应,形成更强的集体智能?受弗里德里希·哈耶克关于市场分散协调的经济理论启发,我们通过一个智能体经济体来研究这一问题。在该经济体中,智能体通过拍卖竞争行动权、交换支付,并从环境奖励中积累财富。这些简单的经济信号引发了分散的信用分配,推动了无需全局协调或显式通信协议的规划。种群通过经济选择进行演化:有效的智能体积累财富并通过利用机制发生变异,而无效的智能体则破产并通过探索机制被替换。我们证明,即使初始化为弱智能体,该经济体也能产生涌现的多步推理策略,并在五个智能体任务(包括数学推理、金融研究、科学研究、加速器设计和分布式系统优化)中超越更强的单一基线模型。我们进一步提供了关于经济动态如何塑造智能体行为的理论见解,将局部激励与长期全局表现联系起来。我们的结果表明了一条通往多智能体智能的新路径:与其设计协调机制,不如设计去中心化的激励结构,让智能自动涌现。
查看缓存全文
缓存时间: 2026/06/03 09:35
# 思维经济:具有经济交互的涌现性多智能体智能
来源:https://arxiv.org/html/2606.02859
Zhenting Qi![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg),\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\},\}Huangyuan Su![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg),![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Kempner-logo_Full-Color-Harvard.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\},\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Kempner\-logo\_Full\-Color\-Harvard\.jpg\}\}\}Ao Qu![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/MIT_logo_2003-2023.svg.png)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=4\.78339pt\]\{logos/MIT\_logo\_2003\-2023\.svg\.png\}\}\}Chenyu Wang![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\}\} Yu Yao![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/MIT_logo_2003-2023.svg.png)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=4\.78339pt\]\{logos/MIT\_logo\_2003\-2023\.svg\.png\}\}\}Han Zheng![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/MIT_logo_2003-2023.svg.png)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=4\.78339pt\]\{logos/MIT\_logo\_2003\-2023\.svg\.png\}\}\}Kushal Chattopadhyay![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\}\}Guowei Xu![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\}\} Zihan Wang![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/2077.jpeg)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=3\.98611pt\]\{logos/2077\.jpeg\}\}\}Weirui Ye![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/MIT_logo_2003-2023.svg.png)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=4\.78339pt\]\{logos/MIT\_logo\_2003\-2023\.svg\.png\}\}\}Vijay Janapa Reddi![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\}\}Ju Li![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/MIT_logo_2003-2023.svg.png)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=4\.78339pt\]\{logos/MIT\_logo\_2003\-2023\.svg\.png\}\}\}Paul Pu Liang![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/MIT_logo_2003-2023.svg.png)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=4\.78339pt\]\{logos/MIT\_logo\_2003\-2023\.svg\.png\}\}\} Himabindu Lakkaraju![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\}\}Sham Kakade![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg),![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Kempner-logo_Full-Color-Harvard.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\},\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Kempner\-logo\_Full\-Color\-Harvard\.jpg\}\}\}Yilun Du![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg),![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Kempner-logo_Full-Color-Harvard.jpg),\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\},\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Kempner\-logo\_Full\-Color\-Harvard\.jpg\}\},\}11footnotemark:1 ![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Harvard-Crimson-Logo-2002.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Harvard\-Crimson\-Logo\-2002\.jpg\}\}\}哈佛大学![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/MIT_logo_2003-2023.svg.png)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=4\.78339pt\]\{logos/MIT\_logo\_2003\-2023\.svg\.png\}\}\}麻省理工学院![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/2077.jpeg)\{\}^\{\\raisebox\{\-0\.2pt\}\{~\\includegraphics\[height=3\.98611pt\]\{logos/2077\.jpeg\}\}\}2077AI![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/Kempner-logo_Full-Color-Harvard.jpg)\{\}^\{\\raisebox\{\-0\.2pt\}\{\\includegraphics\[height=6\.3778pt\]\{logos/Kempner\-logo\_Full\-Color\-Harvard\.jpg\}\}\}Kempner Institute [![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/github.jpg)GitHub](https://github.com/zhentingqi/EoM)[![[未加标题的图片]](https://arxiv.org/html/2606.02859v1/logos/web.png)项目页面](https://zhentingqi.github.io/internal/projects/EoM)
## 摘要
一个由智能体组成的群体如何在无中央控制的情况下实现自我协调与自适应,从而形成更强的集体智能?受弗里德里希·哈耶克关于市场分散协调经济理论的启发,我们通过一个**智能体经济体**来研究这个问题:在该经济体中,智能体通过拍卖竞争行动权、交换支付,并从环境奖励中积累财富。这些简单的经济信号实现了分散化的信用分配,无需全局协调或明确的通信协议即可驱动规划。该群体通过经济选择演化:有效的智能体积累财富并通过利用(exploitation)发生变异,而无效的智能体则破产并通过探索(exploration)被替换。我们证明,在初始化使用弱智能体的情况下,该经济体能够涌现出多步骤推理策略,并在五个智能体任务中超越更强的单一体基线,包括数学推理、金融研究、科学研究、加速器设计和分布式系统优化。我们进一步从理论上阐述了经济动力学如何塑造智能体行为,将局部激励与长期全局绩效联系起来。我们的结果表明了一条通向多智能体智能的新路径:与其设计协调机制,不如设计分散化的激励结构,让协调自动涌现。
参见图注
图1: 一个智能体社会在任务流上的演化过程。每个面板显示在给定阶段的人口情况,智能体在此过程中被持续创建、选择、连接和淘汰。随着社会遇到更多任务,无效的智能体被移除和纠正,而有用的智能体则持续存在并多样化,从而形成一个活跃且结构不断趋于有序的群体。
## 1 引言
想象一个由众多智能体组成的世界。每个智能体在某些任务上可能表现良好,但它们本质上都有限制:每个智能体都基于自身的先验知识、对环境的局部观察以及有限的计算资源运行。当面临超出个体能力的复杂任务时,没有一个智能体能够可靠地从开始到结束解决问题。那么,这样一个群体如何共同解决这些任务呢?一种自然的方法是引入一个中央协调器,负责创建智能体、分配专门化角色,并在智能体之间协调行动[19 (https://arxiv.org/html/2606.02859#bib.bib19),32 (https://arxiv.org/html/2606.02859#bib.bib32),46 (https://arxiv.org/html/2606.02859#bib.bib46)]。然而,这种集中式系统存在两个根本性的局限。首先,规划受限于单一的协调网关:所有信息和决策都必须经过协调器,这既造成了性能瓶颈,也带来了单点故障[6 (https://arxiv.org/html/2606.02859#bib.bib6),49 (https://arxiv.org/html/2606.02859#bib.bib49)]。其次,随着系统规模扩大,学习和适应变得越来越低效。随着智能体数量的增加,协调器必须推理和管理不断扩大的智能体集合,导致协调复杂度随系统规模线性增长[49 (https://arxiv.org/html/2606.02859#bib.bib49),22 (https://arxiv.org/html/2606.02859#bib.bib22)]。这些局限促使我们转变视角:与其问如何构建更好的中央控制器,不如问一个智能体群体能否形成分散化的智能,自我组织成强大的集体能力,并随时间自然演化。
这些问题在当下尤其引人深思。大型基础模型(如大型语言模型LLMs和世界行动模型)的进展,使得实例化能够推理、使用工具并在开放式数字或具身环境中运行的智能体成为可能[50 (https://arxiv.org/html/2606.02859#bib.bib50),30 (https://arxiv.org/html/2606.02859#bib.bib30),21 (https://arxiv.org/html/2606.02859#bib.bib21),51 (https://arxiv.org/html/2606.02859#bib.bib51)]。然而,这些智能体通常经过精心工程化并针对特定领域定制,引入了可能妨碍通用性的归纳偏置。此外,底层模型的约束(如有限的上下文长度、部分知识和受限的推理预算)加上环境的限制(如部分可观察性和受限的工具访问),使得单个智能体难以独自解决复杂、组合性的任务[28 (https://arxiv.org/html/2606.02859#bib.bib28),20 (https://arxiv.org/html/2606.02859#bib.bib20),39 (https://arxiv.org/html/2606.02859#bib.bib39)]。因此,除了改进这些独立智能体,提升智能体智能的另一个维度是将这些天生受限的智能体组织成一个整体可学习的高效系统[7 (https://arxiv.org/html/2606.02859#bib.bib7),48 (https://arxiv.org/html/2606.02859#bib.bib48),33 (https://arxiv.org/html/2606.02859#bib.bib33)]。
人类社会中的经济体系为这种分散化智能提供了直觉。在哈耶克的开创性论文《知识在社会中的运用》[14 (https://arxiv.org/html/2606.02859#bib.bib14)]中,他指出经济体系的核心问题不是在已知信息下的优化,而是利用分散在个体中的知识,而这种知识无法由任何中央权威汇总。哈耶克的关键见解是,自由市场通过价格体系解决了这个问题:价格作为信号,汇总并沟通分散的信息,使个体能够在没有全局意识的情况下协调行动。因此,大规模社会秩序通过竞争、专业化和交换从分散的互动中涌现。在此基础上,鲍姆进一步论证,经济组织为智能提供了一个具体模型,即使个体程序很简单[1 (https://arxiv.org/html/2606.02859#bib.bib1),2 (https://arxiv.org/html/2606.02859#bib.bib2)]。他的“哈耶克机”表明,经济压力作为信用分配的自然机制,决定了哪些程序执行行动、它们如何被连接以及如何在没有中央评估的情况下更新。
在这项工作中,我们证明简单的经济激励足以让现代智能体作为一个社会自我组织和自我演化。我们提出了**Economy of Minds (EoM)**,一个系统,其中智能体群体通过拍卖竞争行动权,通过点对点交易交换支付,并根据结果奖励积累或失去财富。那些持续为成功轨迹做出贡献的智能体自然积累财富,因此得以存活并定期通过利用(exploitation)发生变异,而无效的智能体则通过经济选择被淘汰并通过探索(exploration)被替换。重要的是,每个智能体纯粹在本地运行:它只需要(1)一个唤醒条件,以及(2)相应地执行其行动。不需要全局意识、显式协调、设计的拓扑结构或规定的通信协议。我们使用基于LLM的智能体实现该框架,并在五个数字智能体任务上进行评估,其中EoM将数学推理从15.9%提升到57.0%,将金融研究性能从45.0%提高到60.0%,将科学研究准确率从基线5.0%提高到20.0%,将加速器设计的平均能量延迟积从强领域特定方法的80.2降低到39.3,并在分布式系统优化中达到最佳成本657,而基线为930。在这些领域,我们通过详细案例展示,智能体社会逐渐自组织成有效的工作流:能干的智能体持续存在、变异并专业化,而较弱的智能体被修剪和改进,从而产生涌现结构和持续适应能力。我们的发现表明,经济组织为分散化多智能体智能提供了一个简单、通用且可扩展的基础。与其显式设计协调机制,我们可以定义一个激励结构,让协调、专业化和合作在智能体之间自然涌现。这指向了大型基础模型时代多智能体系统的一个更广泛的范式:不是作为集中工程化的流水线,而是作为不断演化的智能体社会,其集体智能由它们所居住的经济体塑造。
## 2 语言智能体的经济体
我们模拟一个由语言智能体组成的社会,通过经济机制进行交互。每个智能体在本地运行,仅基于自身的触发条件和策略做出决策,而全局协调则从经济互动中涌现。该系统由两个耦合的过程组成:(1) **规划**,它控制智能体在一个回合内如何行动并为其分配信用;以及(2) **适应**,它控制群体在不同回合之间如何演化。
### 2.1 问题设定
我们将任务环境建模为一个部分可观察马尔可夫决策过程 E = (S, A, P, r, γ, μ₀),其中S是状态空间,A是动作空间,P(s'∣s,a)是转移核,r: S×A→R是奖励函数,γ∈(0,1]是折扣因子,μ₀是初始状态分布。在时间步t,系统观察到oₜ∈O;在完全可观察设定下,oₜ=sₜ。
每个智能体由一个参数为θ的语言模型实现。这里我们采用简化设定:所有智能体共享一个固定的冻结模型骨干,多样性完全通过系统提示生成。形式上,一个智能体是一个元组 a = (φₐ, πₐ, bₐ, Wₐ),其中φₐ: O→{0,1}是一个**触发谓词**,决定智能体是否有资格行动;πₐ: O→Δ(A)是其行动策略;bₐ∈R≥₀是智能体的固定出价;Wₐ∈R是其当前财富。φₐ和πₐ都由同一个冻结LLM实例化,使用智能体特定的提示 pₐ = (pₐ^trig, pₐ^act):φₐ(o) = LLMₒ(pₐ^trig; ...)相似文章
思维经济:基于经济交互的新型多智能体智能涌现
本文提出了一种受哈耶克经济理论启发的“智能体经济”框架,其中智能体通过基于拍卖的竞争和经济选择实现自组织,无需集中控制即可产生涌现的多步推理和集体智能。该框架在包括数学推理、金融研究和科学研究在内的五项智能体任务中,均优于更强的单一架构基线模型。
@neural_avb: 研究心智经济,哈佛新论文 他们构建了一个去中心化多智能体系统,智能体在其中协调……
哈佛新论文提出一个去中心化多智能体系统,智能体在类市场环境中通过拍卖和支付进行协调。
Agent Bazaar:在多智能体市场中实现经济对齐
介绍Agent Bazaar,一个用于评估LLMs经济对齐的多智能体模拟框架,识别出算法不稳定性和Sybil欺骗等失败模式,并通过针对性强化学习训练出一个超越前沿模型的9B模型。
AI科学与经济:系统图谱
本文认为,尽管AI在模式识别和假设生成方面表现出色,但科学和经济的进步需要与现实世界的接地互动以及制度执行,强调了人机协作的必要性。
城市经济学能否帮助建模和改善自主AI系统?
本文探讨了城市经济学中的概念(如交通、分区和污染)如何建模自主AI系统中的外部性。文章引入了行为外部性乘数(BEM),并提出了一个包含架构层、基底层和治理层的分层框架,以衡量和减轻廉价AI行为带来的高昂后果。