传染张量:多智能体大语言模型系统中输出分布耦合的测量框架——及其支持的声明审计

arXiv cs.LG 论文

摘要

介绍了传染张量和耦合放大因子(CAF),这是一种基于基线参考的无量纲比率,用于量化多智能体大语言模型系统中的输出分布耦合,并通过在DeepSeek-Chat和GPT-4o-mini上的真实API实验进行了验证。

arXiv:2606.28839v1 公告类型:新 摘要:我们提出了传染张量,这是一个用于量化大语言模型(LLM)输出分布在模态、智能体和时间步之间如何耦合的测量框架。从该张量我们推导出耦合放大因子(CAF),一系列基于比值的度量,形式为 CAF = E[T_condition] / E[T_baseline],提供无量纲、基于基线参考的测量,并附有自助法置信区间。我们在四个变体中实例化了CAF,并在一个完整的2×2×2块正交模拟设计中评估了最强变体,结合了模态特异性消融。消融结果显示,当图像扰动模块被禁用时,一个看似图像条件的超线性效应(CAF = 1.40)坍缩到次线性(CAF = 0.87),变化量为-0.53,而对文本条件没有影响。我们补充了跨两个模型系列的真实API实验:DeepSeek-Chat (R=30) 和 GPT-4o-mini (R=15,真实视觉)。在统一角色下,纯文本通信在两个模型中都产生约1.0的CAF。多样化角色则导致收敛(CAF = 0.88)。在GPT-4o-mini上的模型内比较显示:C3(文本)CAF = 1.02 对比 C5(真实视觉,R=30)CAF = 1.72 [1.700, 1.733],差值 = +0.70,验证了模拟中超线性图像条件的预测。在11个条件中,5个已在真实API上测试,6个尚未验证。我们的贡献有两个层面:(1)一个度量工具,使输出分布耦合可定量证伪;(2)一个可迁移的消融协议,任何模块化多智能体模拟器都可以采用,以区分真实耦合与设计伪迹。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:29

# 多智能体大语言模型中输出-分布耦合的测量框架——及其所支持声明的审计

来源:https://arxiv.org/html/2606.28839

###### 摘要

我们引入了**传染张量** \( \mathfrak{T} \in \mathbb{R}^{M \times N \times T} \),这是一个用于量化大语言模型(LLM)输出分布在模态 \( M \)、智能体 \( N \) 和时间步 \( T \) 之间耦合程度的测量框架。基于该张量,我们推导出**耦合放大因子**(CAF),这是一类比值度量,统一形式为 \( \text{CAF} = \mathbb{E}[\mathfrak{T}_{\text{condition}}] / \mathbb{E}[\mathfrak{T}_{\text{baseline}}] \)。CAF 提供了一种无量纲、基于基线参考的测量,并附有自助法置信区间,适用于任何可以将智能体输出分布离散化的多智能体配置。

我们通过四个变体实例化 CAF——网络(\( \text{CAF}_{\text{net}} \))、跨模态(\( \text{CAF}_{\text{cross}} \))、时间(\( \text{CAF}_{\text{temp}} \))和全轴参考(\( \text{CAF}_{\text{base}} \))——每个变体替代了先前工作中冲突的 \( \Gamma \) 符号。最强的变体(\( \text{CAF}_{\text{base}} \))在完整的 \( 2 \times 2 \times 2 \) 块正交模拟设计中进行了评估,并带有模态特异性消融。消融实验显示,一个明显的图像条件超线性效应(\( \text{CAF} = 1.40 \))在禁用图像扰动模块后坍缩为次线性(\( \text{CAF} = 0.87 \)),偏移量为 \(-0.53\),且对文本条件无影响。

我们通过两个模型系列的实时 API 实验补充了模拟:DeepSeek-Chat(\( R=30 \),包括统一人格和多样化人格)和 GPT-4o-mini(\( R=15 \),模型内,真实视觉)。在统一人格下,纯文本 BOUNDARY_SYNC 在两个模型中都产生 \( \text{CAF} \approx 1.0 \)。多样化人格导致收敛(\( \text{CAF} = 0.88 \))。GPT-4o-mini 上的模型内比较显示:C3(文本)\( \text{CAF} = 1.02 \) 对比 C5(真实视觉,\( R=30 \))\( \text{CAF} = 1.72 \) [1.700, 1.733],\( \Delta = +0.70 \),验证了模拟的超线性图像条件预测。在 11 个条件中,5 个已在真实 API 上测试,6 个尚未验证。

我们的贡献有两个层面:(1) 在测量工具层面,CAF 系列——一种基于基线参考的无量纲比值——首次使输出-分布耦合在量级上可被证伪;(2) 在方法论层面,一种可迁移的消融协议,任何模块化多智能体模拟器均可采用,以区分真正的耦合效应与设计伪影。该框架、协议和审计共同提供了该领域目前所缺乏的工具和标准。

## 1 引言

当多个 LLM 交互时——无论是作为聊天机器人集成体、检索增强系统,还是基于智能体的社会模拟——它们的输出分布在反复交流中不断演化。某个智能体的偏见可能通过网络传播,以单模型基准无法捕捉的方式耦合输出[1, 2]。然而,该领域缺乏一个可重用的测量框架来应对这一现象。我们已有单模型偏见探针(BBQ[5]、StereoSet[6])和定性多智能体案例研究[1],但缺乏一个原则性的度量来回答诸如:添加第二个模态在多大程度上放大了耦合?记忆是否会增加时间持续性?在条件 A–D 上进行的校准运行能否保证对条件 E–H 的测量有效?

本文提供了度量、测量协议和审计。

**该框架。** 我们定义了**传染张量** \( \mathfrak{T} \in \mathbb{R}^{M \times N \times T} \),其中每个单元格 \( \mathfrak{T}[m,n,t] = \operatorname{D}_{\text{JS}}(w_{n,t}^m \| w_0) \) 是智能体输出分布相对于均匀参考的詹森-香农散度。基于该张量,我们推导出耦合放大因子(CAF),这是一类比值度量,均采用相同形式——条件除以基线——但扰动轴不同(表1)。这一统一替换了我们先前工作中四个冲突的 \( \Gamma \) 符号,统一为一个符号。

**最强案例。** 我们在一个 \( 2 \times 2 \times 2 \) 全因子模拟(模态 × 智能体数量 × 时间步数量)中实例化 \( \text{CAF}_{\text{base}} \)。在默认参数下,图像条件呈现超线性(\( \text{CAF}_{\text{image}} = 1.40 \)),而文本条件呈现次线性(\( \text{CAF}_{\text{text}} = 0.84 \))——表面上看,这是一个由模态驱动的分叉。随后,我们禁用了模拟器中区分图像与文本的单一模块。所有四个图像条件从超线性坍缩为次线性(\( \Delta = -0.53 \));文本条件未受影响。该“分叉”是一个伪影。

**审计。** 我们编制了一份验证完整性表(表11),报告了每个 CAF 变体的实证状态。在 11 个条件中,5 个已在两个模型家族的实时 API 上测试,这些测试使用了功能性的 BOUNDARY_SYNC 通信和受控人格(C3u 和 C8u 在 \( R=15 \) 条件下,C3d 在 \( R=30 \) 条件下,C5 在 \( R=30 \) 条件下)。在这些受控条件下,C3 和 C8u 均收敛于 \( \text{CAF} \approx 1.0 \),表明功能性 BOUNDARY_SYNC 通信本身——没有人格多样性——相对于隔离状态并未显著改变输出-分布耦合。先前报告的符号反转(C3 从 0.877 到 3.300,在 \( R=5 \) 条件下)是小样本噪声伪影。我们记录这一解析并非为了淡化早期差距,而是为了证明 CAF 在足够重复次数和受控混杂因素下的测量会收敛到理论预期值。

**本文是什么。** 它在两个不同层面皆有含义。在测量工具层面,它是一个首次使输出-分布耦合在量级上可被证伪的框架。在方法论层面,它是一个可迁移的消融协议,任何模块化多智能体模拟器均可采用,以区分真正的耦合效应与设计伪影。它并非关于涌现行为的声明。它建立在这样一个前提之上:使一个现象可测量——并提供审计这些测量的工具——是一项科学贡献,即使最初的测量揭示出更多是关于仪器而非现象本身的信息。

## 2 相关工作

##### 多智能体 LLM 系统。

生成式智能体[1]、多智能体辩论[3]和谈判[4]展示了涌现的社会动力学,但测量的是任务性能,而非输出-分布耦合。包括 MetaGPT[23]、CAMEL[24] 和 AutoGen[25] 在内的框架为多智能体工作流提供了工程基础设施,但未提供标准化的耦合度量。基于智能体的建模教科书提供了模拟方法论[11],但未提供耦合度量。我们的 CAF 是正交的:它量化输出耦合的程度,与任务成功无关。

##### LLM 偏见评估。

单模型偏见探针——BBQ[5]、StereoSet[6]、Winogender[7] 以及更广泛的安全基准[2]——测量静态分布差异。文本生成的信息论多样性度量[8]量化输出多样性,但不量化智能体间耦合。CAF 填补了单模型偏见测量与多智能体动力学之间的空白。

##### 模拟伪影检测。

模拟模型的验证与确认有着悠久历史[9, 10, 11]。标准协议(ODD[12])要求设计文档,但未规定模块特定的消融。我们的模态消融协议提供了一种具体、可迁移的程序,适用于任何具有独立可切换模块的多智能体 LLM 模拟器。

##### 网络传染与谱方法。

阈值模型[13]和谱流行病学[14]对网络中的传播进行建模。JSD 已被用作多智能体环境中的散度度量[15],但未作为耦合比值的基础。\( \text{CAF}_{\text{net}} \) 通过平均场映射将谱半径与分布耦合联系起来(见 §4.2,表1)。

##### 多智能体耦合度量。

近期几个框架从互补角度针对多智能体 LLM 系统中的动力学和耦合。CASPIAN 监控因果影响张量和谱传播,用于多智能体系统中的级联攻击检测[16]。Riedl (2026) 使用部分信息分解结合时间延迟互信息来分离多智能体协调中的协同信息、冗余信息和独特信息[17]。Bridgeford & Helm (2026) 采用时间数据核视角空间嵌入来检测黑盒多智能体系统中的行为变化[18]。MultiAgentBench 评估 LLM 智能体团队中的协作与竞争质量[19]。G-Memory 引入基于层级图的多智能体记忆[20]。EcoLANG 处理用于社会模拟的智能体通信语言诱导[21]。近期一项关键评估质疑 LLM 是否能可靠地解决基于智能体的建模问题[22]。CAF 与这些方法的不同之处在于它是一个简单的、基于基线参考的比值,仅需离散化的输出分布和一个参考条件——无需因果建模、信息分解或核嵌入。这种简洁既是优势(易于采用),也是局限(捕捉耦合的程度而非结构)。未来的工作应将 CAF 与这些更丰富的度量在共享的多智能体基准上进行对比。

## 3 传染张量框架

### 3.1 传染张量

考虑一个包含 \( M \) 种模态、\( N \) 个智能体、\( T \) 个离散时间步和 \( K \) 个输出类别的系统。对于每个 \( (m,n,t) \),智能体 \( n \) 产生一个输出,其在各类别上的分布为 \( w_{n,t}^m \in \Delta^{K-1} \)。

###### 定义 1(传染张量)。

\( \mathfrak{T} \in \mathbb{R}^{M \times N \times T} \),其中 \( \mathfrak{T}[m,n,t] = \operatorname{D}_{\text{JS}}(w_{n,t}^m \,\|\, w_0) \),\( w_0 \) 为均匀参考,\( \operatorname{D}_{\text{JS}} \) 为詹森-香农散度(以 2 为底,单位:比特)。\( \operatorname{D}_{\text{JS}} \) 是对称的,有界于 \( [0,1] \),且 \( \sqrt{\operatorname{D}_{\text{JS}}} \) 是一个标准度量[15]。

每个单元格捕捉单个智能体在某一时刻的分布漂移。完整的张量允许沿着任何轴进行比较:模态效应、智能体级异质性和时间轨迹。

**离散化。** 张量要求智能体输出被离散化为 \( K \) 个类别。对于模拟实验,智能体直接产生 \( K \) 个类别的分类分布(\( K_{\text{sim}} = 10 \))。对于实时 API 实验,自由形式的文本响应通过两阶段过程映射到 \( K_{\text{api}} = 5 \) 个类别:首先,解析响应文本以寻找 JSON 格式的概率分布;如果解析失败,则使用关键词频率匹配与预定义类别标签作为后备方案。完整的离散化流程记录在补充代码中(deepseek_backend.py,方法 `get_strategy_distribution`)。五个实时 API 类别为:中性、偏见_女性、偏见_男性、刻板印象_回避、刻板印象_强化。这些类别同时捕捉偏见方向(女性 vs. 男性)和框架(回避 vs. 强化)。关键词匹配后备方案使用类别名称子串;尚未对此后备方案进行正式人工验证,生产环境中的 CAF 部署应使用结构化提取或独立验证的分类器。对 \( K \) 和类别设计的敏感性在附录 K 中进行了检验:模态分叉在 \( K \geq 10 \) 时清晰显现,在 \( K \leq 5 \) 时减弱,这与更细粒度的类别空间为分布比较提供更多分辨率的预期一致。

**\( w_0 \) 的选择。** 我们使用均匀分布 \( w_0 = (1/K, \dots, 1/K) \) 作为参考,原因有三。第一,它无参数,且普遍适用于不同任务、模型和领域,确保可重复性。第二,在无系统性偏好的零假设下,一个理想智能体将产生均匀分布,因此 \( w_0 \) 是自然的零耦合参考。第三,均匀参考产生有界的 JSD(以 2 为底时 \( \operatorname{D}_{\text{JS}} \leq 1 \);以 \( e \) 为底时 \( \operatorname{D}_{\text{JS}} \leq \ln 2 \approx 0.693 \)),这使 CAF 比值可解释。我们注意到,在已知非均匀先验分布的情况下,任务特定的或经验基础的参考(例如,每个条件的经验边际)可能更为合适;CAF 支持通过替换 \( w_0 \) 来使用此类参考,而无需修改比值公式。

参见图注

**图 1:** 传染张量 \( \mathfrak{T} \in \mathbb{R}^{M \times N \times T} \)。每个单元格 \( \mathfrak{T}[m,n,t] = \operatorname{D}_{\text{JS}}(w_{n,t}^m \| w_0) \) 编码单个智能体在某一时间步的分布相对于均匀参考的散度。颜色越暖表示 JSD 越大(偏离均匀性越大)。(概念示意图;单元格颜色为合成数据,并非来自实验数据。)

### 3.2 CAF 系列

###### 定义 2(CAF 系列)。

每个变体是张量期望的比值:

\[
\text{CAF}_v = \frac{\mathbb{E}[\mathfrak{T}_{\text{condition}}]}{\mathbb{E}[\mathfrak{T}_{\text{baseline}}]}, \qquad \mathbb{E}[\mathfrak{T}] = \frac{1}{MNT} \sum_{m,n,t} \mathfrak{T}[m,n,t].
\]

\( \text{CAF} > 1 \):耦合放大。
\( \text{CAF} = 1 \):独立叠加。
\( \text{CAF} < 1 \):耦合抑制。

相似文章

BOUNDARY_SYNC: 测量多智能体LLM系统中通信引起的表征耦合

arXiv cs.LG

本文介绍了Boundary_Sync,一种测量多智能体LLM系统中表征耦合的协议。使用GPT-4o的实验表明,通信在文本和图像两种模态中均导致了显著的同质化,但群体规模调节了方向:较大群体导致同质化,较小群体导致多样化。

情感如何在LLM智能体间传播:人群模拟中的涌现情感传染

arXiv cs.AI

本文提出了一种多智能体人群模拟,使用LLM驱动的智能体通过视觉、听觉和触觉通道相互感知和评估,导致涌现的情感传染,无需显式手工编写的情感转移。研究展示了在五个场景中空间、时间和人格依赖的传染动态,并评估了后端依赖的评估行为。

多智能体LLM校准的反事实图

arXiv cs.CL

本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。

潜在通道真的在通信吗?潜在多智能体LLM的因果审计

arXiv cs.AI

本文提出了一种因果审计方法,用于评估LLM智能体之间的潜在通信通道是否真正传递了与任务相关的信息,并将性能影响分解为消息存在性、内容以及特定智能体的贡献。应用于Qwen3模型后,结果表明仅凭总体准确率无法识别潜在消息的因果作用。