前沿LLM智能体经济中的信息极限与吸引子动力学:一项预注册测试
摘要
本文报告了一项关于前沿LLM智能体(Claude Opus 4.8)小型经济的预注册实验,测试了关于财富增长的信息论容量区域以及人口失调的平均场残差标度律的预测。结果证实了将智能体知识与收益联系起来的定量信息定律,但拒绝了平均场假设,揭示了离散吸引子动力学。
查看缓存全文
缓存时间: 2026/07/08 04:39
# 前沿LLM智能体经济中的信息极限与吸引子动力学:一项预注册检验
来源:https://arxiv.org/html/2607.06001
###### 摘要
我们报告了一项预注册、分两部分进行的实验,研究对象是前沿语言模型智能体 (Claude Opus 4.8) 组成的小型经济系统。实验检验了两个关于耦合多智能体系统的定量预测:一个是市场耦合下财富增长的信息论*容量区域*,另一个是在激励和控制杠杆下群体失调的平均场*残差标度律*。所有预测、接受区间和决策规则均在每次运行前被冻结在一个公开的 git 链中;每个报告的数字均由缓存中的模型输出机械推导得出;整个实验在计费 API 上的花费为 138.76 美元,且可从缓存中以零成本重新运行。
**结果1(确认)**:在互相耦合的经济体中,相对增长等于相对声称信息——缺口律 \( \hat{G}_a - \hat{G}_b = \hat{I}_a - \hat{I}_b \) 在四种感知结构下的最坏情况偏差为 46 millinats(预注册区间:50);当信道条件独立时,联盟价值恰好是子模的,而设计的一个 XOR 协同控制使其以 0.62 ≥ ln2/2 nats 的量翻转成为超模,智能体能够推理出联合比特;联合增长上限 \( \hat{G}_S \le H(X) \) 精确成立;在 4/5 的市场种子中,信息最灵通的智能体吸收了几乎整个财富池。这是一个可量化、可证伪的定律,将智能体可测量的知识与可测量的收益联系起来,并在前沿模型上得到了验证。
**结果2(结构性负面)**:残差标度检验返回“未找到领域”。在所有 72 次群体运行中,目标分散度崩溃(\( V \to 0 \);最大值为 4.85,低于冻结的下限 5.31),群体对两个杠杆的响应是跨越支配边界 \( \gamma \gtrless \frac{1}{2}g \) 的阶跃函数,而非平滑响应,并且边界附近的细胞具有双稳态,由种子选择结果。加上先前的两个小模型臂(梯度饱和;无响应),在任何测试能力水平的 LLM 群体中,均未实现噪声维持分散度 regime(平滑平均场模型所假设的那种)。近理性 LLM 群体表现为离散的吸引子系统——局部近似确定性,全局对种子敏感——这意味着对此类系统的群体级干预要么切换吸引子,要么无效,而非起到边际作用。我们发布了完整的协议、预注册链、调用缓存和分析代码。
## 1 引言
语言模型智能体之间的互动日益增多——无论是在模拟社会 [Park et al., 2023](https://arxiv.org/html/2607.06001#bib.bib11)、经济模拟 [Horton, 2023](https://arxiv.org/html/2607.06001#bib.bib12); [Li et al., 2024](https://arxiv.org/html/2607.06001#bib.bib13) 中,还是在多个模型实例进行交易、竞价、谈判或竞争资源的新兴部署中。关于这些群体的两个基本问题,在目前前沿能力水平上仍未得到充分检验:
1. 是否存在一个信息论定律支配着 LLM 智能体的收益?经典结果将智能体关于不确定世界的信息与其在重复投注下的财富增长率联系起来 [Kelly, 1956](https://arxiv.org/html/2607.06001#bib.bib1); [Breiman, 1961](https://arxiv.org/html/2607.06001#bib.bib19); [Barron and Cover, 1988](https://arxiv.org/html/2607.06001#bib.bib3); [Cover and Thomas, 2006](https://arxiv.org/html/2607.06001#bib.bib2)。当智能体通过共享支付机制*耦合*时——即一个智能体的收益是另一个的损失——理论预测会出现更尖锐的结构:相对增长率应等于相对信息,联盟价值在感知信道条件独立时恰好表现出递减回报,联合增长应被世界的熵所限制,财富动力学应选择信息最灵通的智能体 [Blume and Easley, 1992](https://arxiv.org/html/2607.06001#bib.bib20); [Sandroni, 2000](https://arxiv.org/html/2607.06001#bib.bib21)。这一切此前均未在真实的前沿 LLM 智能体上测量过。
2. LLM 群体是否对激励和控制杠杆做出平滑响应?常用于思考控制、调节或对齐多智能体系统的选型压力下群体的平均场模型,通常假设一个线性响应 regime,其中群体级失调随奖励梯度 \( g \) 和控制激励 \( \gamma \) 的强度平滑变化。真实的 LLM 群体是否曾处于这样的 regime,是一个对多智能体治理具有直接影响的经验问题 [Critch and Krueger, 2020](https://arxiv.org/html/2607.06001#bib.bib14); [Hammond et al., 2025](https://arxiv.org/html/2607.06001#bib.bib15)。
本文通过一项在 Claude Opus 4.8 上进行的、遵循异常严格规则的预注册实验,回答了两个问题:每一个预测、接受区间、协议门和决策规则,都在其所控制的运行*之前*提交至公共 git 仓库;三次协议修正案均在对结果不知情的情况下、在修正案修改的运行之前提交;每次模型调用均被缓存,使得整个分析是确定性的且可离线重新运行;总计费成本为 138.76 美元。预注册和探索性发现通过排版方式加以区分:凡是未被冻结区间覆盖的内容均标记为**探索性**。
##### 结果1:耦合容量区域成立。
在四种感知结构(在一个 3 比特世界上的不重叠、重叠、克隆和噪声信道)中,互相耦合的缺口律 \( \hat{G}_a - \hat{G}_b = \hat{I}_a - \hat{I}_b \) 的最坏情况偏差为 0.0457 nats,低于预注册区间 0.05(第 5 节)。联盟价值在其区间内是子模的(最差边际 \(-0.019 \ge -0.03\)),而一个设计好的控制——XOR 信道对,其单个信号携带零信息但联合信号携带一个比特——使联盟价值翻转成为超模,幅度为 0.621 nats(\(\ge \ln 2/2 = 0.347\);理想值为 \(\ln 2 = 0.693\)),智能体仅凭提示描述就推理出了奇偶结构。联合上限 \( \hat{G}_S \le H(X) \) 在数值精度内精确成立,在一个 40 轮的实时互相耦合市场中,信息最清晰的智能体在每个种子中都吸收了 \(\ge 99.9\%\) 的财富池,在 4/5 的种子中财富顺序完全由信息量决定。一个支持性检验未通过(第 5.4 节),并披露了其机制:具有相同信息的克隆智能体未能达到相等的最终财富。
##### 结果2:平均场 regime 在任何测试的 LLM 群体中均不存在。
被检验的残差标度律预测群体失调 \(\propto V g / \gamma\),存在于一个需要噪声维持的目标分散度 \(V \gg 0\) 的线性响应 regime 中。预注册裁决为“无法通过”(CAP):九个网格条件中零个处于该 regime,因为所有 72 次运行中分散度均崩溃(最大 \(V = 4.85\),中位数 0.00,冻结下限 5.31;第 6 节)。网格发现的结构性结果是:群体*总是*集中——当 \(\gamma\) 超过峰值激励支付 \(\frac{1}{2}g\) 时集中在控制目标上(三个单元在所有 8 个种子中恰好为 \(0.000 \pm 0.000\)),当激励占优时集中在奖励峰值附近或之上,并且当两个吸引子可比较时呈现*双稳态*,结果由种子选择。结合同一程序先前的两个小模型臂——群体饱和了梯度窗口或完全无响应——三种不同能力水平的仪器从各个方向包围了平均场假设。我们得出结论,该定律的领域尚未在真实 LLM 群体上找到,并将其归入其数学范围:*已退休,而非证伪*。
##### 贡献。
- 首次在 LLM 智能体前沿模型上获得(市场)耦合容量区域结构的预注册确认——缺口律、条件子模性(含设计的协同控制)、精确联合上限以及 Kelly 财富选择(第 5 节)。
- 对于 LLM 群体平滑平均场模型的一个结构性负面结果:72/72 次运行中分散度崩溃、跨越支配边界的阶跃函数响应、以及由种子选择的双稳态,完成了对三个能力水平的仪器包围(第 6 节)。
- 一个完整、廉价、可审计的方法论,用于在前沿模型群体上进行预注册实验:由提交的分析器机械应用的冻结区间、盲修正案、缓存确定性、带硬上限的每次调用费用计量,以及公开的溯源链(第 4, 8 节)。
两个结果被故意以同等地位报告。确认的可信度仅取决于程序公开其负面结果的意愿;而负面结果只有在确认证明仪器能力的情况下才具有可解释性。
## 2 相关工作
##### 信息与增长。
Kelly (1956) 表明,一个对重复事件拥有侧面信息的赌徒,其财富增长率可以等于该事件与信号之间的互信息;Breiman (1961) 和 Cover (1991) 发展了由此产生的增长最优投资组合理论;Barron 和 Cover (1988) 证明了任何侧面信息的增长价值的上界 \(\Delta G \le I(X; Y)\)。Cover 和 Thomas (2006)(第 6 章)是标准参考文献。我们的预测 (i) 检验了这些结果的*耦合*扩展:当智能体在互相耦合池中相互下注时,市场赔率对所有智能体是共同的,从增长*差异*中抵消,得到缺口律 \(G_a - G_b = I_a - I_b\);联盟级信息决定联盟级增长;市场选择将财富集中在信息最灵通的智能体上,这是经典的市场选择动力学 [Blume and Easley, 1992; Sandroni, 2000]。预测市场以制度形式实例化了相同的信息-财富耦合 [Hanson, 2003; Wolfers and Zitzewitz, 2004]。
##### 经济环境中的 LLM 智能体。
LLM 智能体已被用于模拟个体经济行为 [Horton, 2023]、宏观经济活动 [Li et al., 2024] 以及开放式社会互动 [Park et al., 2023]。这些工作询问 LLM 智能体是否*再现类人*行为。我们问一个不同的问题:LLM 智能体经济是否服从以 nats 为单位的*定量信息论定律*,并带有预注册接受区间——以及它们的群体动态是否占据平均场理论所假设的 regime。
##### 多智能体安全。
高级 AI 智能体之间的互动已被认定为一个独特的风险面 [Critch and Krueger, 2020; Hammond et al., 2025],其中许多分析隐含地假设群体级行为对激励和监督做出平滑响应。我们的第二个结果直接针对该假设:在每个测试的群体中,对激励和控制杠杆的响应是吸引子切换,而非边际调整。
##### 预注册。
我们的协议遵循经验科学的预注册纪律 [Nosek et al., 2018]:预测和分析规则在数据收集前冻结并提交,修正案在修正运行前盲提交,负面结果与正面结果以同等重要性发布。我们不知道此前有在 LLM 前沿群体上对定量增长定律进行过预注册检验。
##### 理论伴侣。
被检验的两个预测来自一个配套的综合理论 [Qian, 2026],该理论在统一的信息论资源增长框架内推导了耦合容量区域和残差标度律。本文是自包含的,仅捍卫此处报告的实验;读者无需接受(或阅读)该配套理论的更广泛框架即可评估任一结果。本文中的“价值”仅指 Kelly 意义上的财富增长,别无他意。
## 3 预测与预注册区间
### 3.1 预测 (i): 耦合容量区域
##### 设定。
世界状态 \( X \) 从一个具有已知先验 \( q \) 的有限集合中抽取(此处:三个独立同分布的公平比特,8 个状态,\( H(X) = 3 \ln 2 \approx 2.0794 \) nats)。智能体 \( a \) 通过一个感知信道观察信号 \( Y_a \),并报告一个关于世界状态的后验 \( \hat{p}_a(\cdot \mid y_a) \)。智能体 \( a \) 的*声称信息*是其报告相对于先验的期望 KL 散度:
\[
\hat{I}_a = \mathbb{E}_{y_a} \left[ D\left( \hat{p}_a(\cdot \mid y_a) \,\|\, q \right) \right],
\tag{1}
\]
当报告是精确贝叶斯后验时,该值等于互信息 \( I(X; Y_a) \)。在一个具有等权重的*互相耦合市场*中,每个智能体按比例 \( b_a(x) = \hat{p}_a(x \mid y_a) \) 将其财富投注在各状态上;池赔率由平均投注 \( B(x) = \frac{1}{m} \sum_a b_a(x) \) 形成,获胜者按比例分池。智能体 \( a \) 每轮的期望对数增长为 \( \hat{G}_a = \mathbb{E}[ \ln( b_a(X) / B(X) ) ] \),在 \( (X, Y_{1:m}) \) 的真实联合分布下计算。
##### P1 (缺口律)。
市场项 \( \ln B(X) \) 对所有智能体是共同的,并从差异中抵消,因此相对增长纯粹是信息性的:
\[
\hat{G}_a - \hat{G}_b = \hat{I}_a - \hat{I}_b \quad \text{对所有对 } (a, b) \text{ 成立}.
\tag{2}
\]
当报告是精确贝叶斯后验时,该等式是一个恒等式(共同市场项从差异中抵消);对于引出的报告,它是一个真正的经验预测,其偏差衡量了报告校准误差以及未按其所述信念投注的程度。*冻结区间:在所有四种结构中,所有对的最坏情况成对偏差 ≤ 0.05 nats。* 注意该定律是与校准无关的:共同市场模式抵消,因此不需要任何一侧的绝对锚定。
##### P2 (条件子模性) 和 P2e (协同控制)。
对于一个智能体联盟 \( S \),联盟增长 \( \hat{G}_S \) 是从联盟级引出的后验计算得出的(一个智能体实例被展示所有 \( S \) 的信号;第 4.3 节)。当信道在给定 \( X \) 条件下独立时,联盟价值应表现出递减回报:对于 \( S \subseteq T \) 且 \( a \notin T \),边际相似文章
Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop
This paper proposes a method for simulating large LLM-agent societies on a laptop by fitting low-parameter surrogate models from a few hundred queries, using a statistical-physics-based taxonomy to predict when this approximation holds. The approach is validated on EconAgent and several other simulations using DeepSeek-elicited agent behaviors.
When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains
This paper studies how LLM agents negotiate in a dynamic supply chain bargaining problem, benchmarking nine models from OpenAI, Google, and Alibaba against a Bayesian equilibrium and finding that capability, provider identity, and prompt design shape surplus creation and division.
思维经济:基于经济交互的新型多智能体智能涌现
本文提出了一种受哈耶克经济理论启发的“智能体经济”框架,其中智能体通过基于拍卖的竞争和经济选择实现自组织,无需集中控制即可产生涌现的多步推理和集体智能。该框架在包括数学推理、金融研究和科学研究在内的五项智能体任务中,均优于更强的单一架构基线模型。
LLM交易代理中的表示特征与风险反馈对齐
本文研究了LLM代理在金融交易中的行为对齐与表示动态,介绍了TradeArena测试平台,并发现规划嵌入中存在可测量的故障前特征,这些特征能在多种前沿模型与压力条件下高精度预测回撤。
智能体交易:当LLM智能体遇上金融市场
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。