潜在通道真的在通信吗?潜在多智能体LLM的因果审计
摘要
本文提出了一种因果审计方法,用于评估LLM智能体之间的潜在通信通道是否真正传递了与任务相关的信息,并将性能影响分解为消息存在性、内容以及特定智能体的贡献。应用于Qwen3模型后,结果表明仅凭总体准确率无法识别潜在消息的因果作用。
arXiv:2607.26773v1 公告类型:新
摘要:基于大语言模型(LLM)的多智能体系统(MAS)中的潜在通信传输的是连续的内部表示而非文本,但更强的表示能力并不能证明接收者使用了与任务相关的信息。仅凭最终任务性能也无法揭示观察到的效应是依赖于消息的存在性、针对被评估示例生成的内容,还是由另一个独立智能体提供的信息。我们引入了一种因果审计方法,在发送者生成的表示进入接收者的边界处应用受控的消息替换。四种消息设置支持对以下五个量的测量:发送者编码信息、接收者对消息存在性和身份的敏感度、示例特定内容的任务价值,以及独立智能体提供的附加价值。我们将该审计方法应用于使用Qwen3-4B和Qwen3-8B在GSM8K、ARC-C和MATH-500上的潜在中继(latent relay)。在GSM8K上,Qwen3-4B的总体性能效应为-1.00个百分点,可分解为其他示例消息保留的-6.17个百分点效应和可归因于示例特定内容的+5.17个百分点效应;这两个分量的方向在8B模型上均发生反转。在MATH-500上,Qwen3-4B的15.00分增益包含其他示例消息保留的8.33分和可归因于示例特定内容的6.67分,而8B模型的增益主要由前一分量主导。自我替换比较进一步表明,示例特定内容与其他智能体的价值是截然不同的。这些结果表明,总体准确率无法识别潜在消息如何影响接收者,并促使将受控消息比较作为潜在通信的标准评估方法。
查看缓存全文
缓存时间: 2026/07/31 04:01
# 潜在通道真的在通信吗?对潜在多智能体LLM通信的因果审计
###### 摘要
基于大语言模型 \(LLM\) 的多智能体系统 \(MAS\) 中的潜在通信 \(latent communication\) 传输连续内部表示而非文本,但更大的表示容量并不能证明接收方使用了与任务相关的信息。仅凭端任务性能也无法揭示观察到的效应是否依赖于消息的存在、为被评估示例生成的内容,或由另一个智能体提供的信息。我们引入了一种因果审计方法,在发送方产生的表示进入接收方的边界处施加受控的消息替换。四种消息设置支持对编码在发送方消息中的信息、接收方对消息存在性与身份标识的敏感性、示例特定内容的任务价值,以及独立智能体提供的额外价值进行五项测量。我们将该审计应用于使用 Qwen3-4B 和 Qwen3-8B 在 GSM8K、ARC-C 和 MATH-500 上的潜在中继 \(latent relay\)。在 GSM8K 上,Qwen3-4B 的整体性能效应为−1.00个百分点,可分解为由其他示例消息保留的−6.17个百分点的效应,以及可归因于示例特定内容的+5.17个百分点的效应;在 8B 规模上,两个分量方向均发生反转。在 MATH-500 上,Qwen3-4B 的15.00个百分点的增益包括由其他示例消息保留的8.33个百分点和可归因于示例特定内容的6.67个百分点,而 8B 的增益主要由前一分量主导。自我替换比较进一步表明,示例特定内容与其他智能体价值是截然不同的。这些结果表明,聚合准确率无法识别潜在消息如何影响接收方,并促使将受控消息比较作为潜在通信的标准评估方法。
## 引言
近年来,基于大语言模型 \(LLM\) 的多智能体系统 \(MAS\) 开始探索超越自然语言的通信通道。传统 MAS 通常通过文本消息协调智能体,但文本通信要求智能体将其内部计算投影为离散的 token 序列。这种离散化只暴露了采样得到的符号,同时丢弃了生成过程中表示的其他备选信息\(Phamet al\.2023 (https://arxiv.org/html/2607.26773#bib.bib20); Duet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib5)\)。为克服这一限制,近期研究探索了更丰富的通信载体,包括概率加权嵌入、隐藏状态和键值 \(KV\) 缓存\(Phamet al\.2023 (https://arxiv.org/html/2607.26773#bib.bib20); Zouet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib28); Duet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib5)\)。
我们将这些方法统称为潜在通信:即在通信协议中传输连续的内部表示,如嵌入、隐藏状态或 KV 缓存,而无需中间解码为自然语言。这些方法有一个共同直觉:在通信边界保留更多信息可能为接收方提供比文本交换更丰富的信号。他们也报告了相对于基于文本的通信或单智能体基线的任务性能提升,通常还伴随通信成本或推理开销的降低\(Phamet al\.2023 (https://arxiv.org/html/2607.26773#bib.bib20); Zouet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib28); Duet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib5)\)。
通信后的性能提升可能来自多种来源:跨边界传输的发送方特定内容、通信过程引入的额外计算、上下文复用,或冗余的推理轨迹\(Cemriet al\.2025 (https://arxiv.org/html/2607.26773#bib.bib2)\)。因此,仅凭端任务准确率差异无法确定潜在通信是否实现了真正的信息传输。这种区分类似于神经网络中的因果分析:观察到表示与输出之间的相关性并不能证明该表示介导了计算\(Viget al\.2020 (https://arxiv.org/html/2607.26773#bib.bib24); Menget al\.2022 (https://arxiv.org/html/2607.26773#bib.bib19)\)。潜在通道可能影响接收方行为,但接收方并未使用消息中包含的发送方特定信息\(Loweet al\.2019 (https://arxiv.org/html/2607.26773#bib.bib16)\)。研究问题在于,传输的信息是否在因果上对接收方行为有所贡献。
参见图1:潜在通信的因果审计。\(a\) 发送方产生潜在消息MM,形式为嵌入序列、隐藏状态或 KV 缓存;每次干预都在MM被注入接收方之前移除或替换它,而接收方上下文和下游计算保持不变。\(b\) 一个示例是基准测试集中的一个测试用例。四种消息设置分别为:无消息;其他示例消息,由发送方通过相同通信接口从同一测试集中的不同示例生成,并在长度上近似匹配;计算匹配的自我生成消息;以及当前示例消息,由被评估示例生成。它们的比较在预测分布层面定义 PL 和 CIC,在任务性能层面定义整体性能效应、CAG 和 SSG。PS 则检验发送方答案的正确性是否可以从MM中解码。\(c\) 在 GSM8K 上使用 LatentMASλH\\lambda\_\{H\}时,整体性能效应分解为其他示例消息效应加上 CAG:Qwen3-4B \(n=100n=100\) 为−1.00=−6.17\+5.17\-1.00=\-6.17\+5.17个百分点 \(pp\),Qwen3-8B \(n=60n=60\) 为\+1.67=\+3.96−2.29\+1.67=\+3.96\-2.29个百分点。条形显示点估计,须线显示95%置信区间。4B 的近似为零的整体效应结合了两个方向相反且区间排除零的效应;两个分量估计在 8B 处均反转符号;区间跨越零点既不能确定符号也不能确定可忽略性。现有的基于 LLM 的 MAS 分析尚未提供这样的识别检验。失败分类法描述了反复出现的协调问题,而近期的反事实研究则对单个智能体、通信边或无可通信拓扑进行干预,以研究错误传播和相关一致性\(Cemriet al\.2025 (https://arxiv.org/html/2607.26773#bib.bib2); Shenet al\.2025 (https://arxiv.org/html/2607.26773#bib.bib22); Huanget al\.2026 (https://arxiv.org/html/2607.26773#bib.bib8); Liet al\.2026b (https://arxiv.org/html/2607.26773#bib.bib11)\)。这些分析确定了通信对系统是有益还是有害,但没有确定潜在消息中的哪些信息导致了这种效应。现有的分类法按传输表示、发送方-接收方对齐和接收方侧融合机制对潜在通信方法进行分类,但并未检验接收方是否使用了为被评估示例生成的内容\(Liu2026 (https://arxiv.org/html/2607.26773#bib.bib14)\)。
我们引入了一种因果审计,在消息进入接收方之前对其进行干预,同时保持接收方上下文和下游计算不变。我们用“示例”指代基准测试集中的一个测试用例。当前示例消息是发送方从被评估示例生成的原始消息。第一个问题是消息是否包含关于发送方的信息。正信号 \(PS\) 询问一个已声明的发送方变量是否可以从消息中解码。在本工作中,主要变量是发送方自身答案是否正确。PS 衡量消息中编码的信息,而非接收方是否使用该信息。只有当消息改变时接收方行为也随之改变,编码信息才能确立接收方的使用。因此,正听 \(PL\) 比较接收方在当前示例消息和无消息两种情况下的预测分布。这一比较询问消息存在性是否对接收方产生任何影响,但尚未识别消息中哪一部分导致了变化。
为了检验来自被评估示例的内容是否重要,我们将当前示例消息替换为其他示例消息。其他示例消息由发送方从同一测试集中的不同示例生成,并在长度上近似匹配。由于它是通过相同通信接口由模型生成的,因此保留了原始消息的结构,但其内容来自另一个示例。通信的因果影响 \(CIC\) 衡量接收方预测分布在当前示例消息与其他示例消息之间的变化。内容可归因增益 \(CAG\) 衡量相应的带符号任务性能差异。CIC 检验消息身份标识是否影响接收方预测,而 CAG 则分离出为被评估示例生成的内容的任务价值。为被评估示例生成的内容可能是有用的,但这并不要求存在一个独立的智能体。因此,自我替换差距 \(SSG\) 将发送方的当前示例消息与接收方在匹配的计算预算下通过相同通信接口生成的自我生成消息进行比较。该比较询问一个独立智能体是否贡献了超出接收方自身生成能力的任务价值。
图1 (https://arxiv.org/html/2607.26773#Sx1.F1)总结了该审计。面板 \(a\) 将嵌入序列、隐藏状态和 KV 缓存放在一个共享的消息边界之后,因此每次干预都在接收方注入之前移除或替换消息。面板 \(b\) 呈现四种消息设置:无消息、其他示例消息、自我生成消息和当前示例消息。它们的比较分离了消息存在性、消息身份标识、示例特定内容和其他智能体价值,而 PS 直接对消息进行测量。面板 \(c\) 显示整体性能效应可以精确分解为其他示例消息效应和 CAG。结果说明了分解的必要性。在 GSM8K 上,Qwen3-4B 的近似为零的整体性能效应结合了两个方向相反的分量,而两个分量的方向在 Qwen3-8B 上均发生反转。在不同的模型和任务上,相似的整体性能可能源于不同的通信机制。我们做出以下贡献:
- •我们将潜在通信表述为容量与使用的问题,并为概率加权嵌入、潜在思维隐藏状态和 KV 缓存提供了统一的因果审计。
- •我们引入了一个由 PS、PL、CIC、CAG 和 SSG 组成的五部分测量套件。该套件分离了消息中编码的信息、接收方对消息存在性和身份标识的敏感性、示例特定内容的任务价值,以及独立智能体贡献的价值。
- •我们开发了一种标准化的干预设计,以四种模型生成的消息设置为核心,并辅以保序诊断阶梯、组件恢复、消息真实性测量、接收方不稳定性检查,以及具有正向、可忽略效应和不确定结果的配对推断。
- •我们提供了潜在通道行为具有异质性的证据:忠实中继在一个运行机制中可能导致性能下降,而另一个机制则同时表现出可观的、可归因于内容的效果和相当的、与内容无关的效果。这种分解改变了对相同端任务准确率增益的解释。
## 相关工作
本节将我们的审计与四条研究线进行对比:潜在通信方法、涌现通信测量、神经表征的因果干预,以及 MAS 通信的系统级分析。表1 (https://arxiv.org/html/2607.26773#Sx2.T1)总结了区分这些研究线的识别性质。
表 1:相关工作的识别性质。列表示每项工作是否研究潜在智能体间消息、是否对消息本身进行干预、是否将从被评估示例生成的内容的效应与在其他示例消息下保留的效应分离开来、是否与计算匹配的自我生成替代方案 \(自我替换\) 比较,以及是否通过基于等价性的推断支持可忽略效应结论。\(∙\\bullet\) 满足;\(△\\triangle\) 部分;\(∘\\circ\) 缺失。潜在智能体间通信建立在单智能体潜在推理工作的基础之上,其中 Coconut 将模型自身的最后隐藏状态作为下一个输入反馈给模型,而不是采样一个 token\(Haoet al\.2025 (https://arxiv.org/html/2607.26773#bib.bib7)\)。多智能体方法用不同的连续表示替代文本消息。CIPHER 在发送方的 token 信念下传输词汇嵌入的期望\(Phamet al\.2023 (https://arxiv.org/html/2607.26773#bib.bib20)\)。LatentMAS 生成潜在思维作为最后一层状态,并将发送方的逐层 KV 缓存作为工作记忆进行中继\(Zouet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib28)\)。DroidSpeak 在同架构模型之间复用 prompt KV 以降低服务延迟\(Liuet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib15)\)。C2C 学习一个投影器和融合模块,将发送方的 KV 缓存注入目标模型\(Fuet al\.2025 (https://arxiv.org/html/2607.26773#bib.bib6)\)。Interlat 在压缩隐藏状态上训练接收方侧适配器\(Duet al\.2026 (https://arxiv.org/html/2607.26773#bib.bib5)\),ThoughtComm 通过共享工作空间融合推断出的潜在思维\(Zhenget al\.2025 (https://arxiv.org/html/2607.26773#bib.bib27)\)。一个最近的框架按载体和注入机制组织这些设计\(Liu2026 (https://arxiv.org/html/2607.26773#bib.bib14)\)。这些方法主要通过端任务性能进行评估,在某些情况下还涉及通信或推理效率。压缩结果进一步挑战了简单的带宽解释:在多个基准上,压缩 KV 中继可以达到或超过完整中继,这表明传输表示的大小并不会单调地映射到下游效用\(Liet al\.2026a (https://arxiv.org/html/2607.26773#bib.bib12)\)。表1 (https://arxiv.org/html/2607.26773#Sx2.T1)中的块A按识别性质定位了这些提案。
涌现通信研究长期以来一直区分发送方编码的信息和接收方使用的信息。指称游戏研究在神经智能体之间诱导协议\(Lazaridouet al\.2017 (https://arxiv.org/html/2607.26773#bib.bib10)\),测量陷阱也随之而来。Loweet al\.\(2019 (https://arxiv.org/html/2607.26773#bib.bib16)\)区分了正信号——即消息依赖于发送方状态——和正听——即接收方行为依赖于消息,并表明广泛使用的指标可以认证前者,而后者可能完全失败。Jaqueset al\.\(2019 (https://arxiv.org/html/2607.26773#bib.bib9)\)使聆听具有因果性,根据消息在接收方策略中引起的反事实偏移来评分。我们将这些构造改编为适用于 LLM 智能体之间连续潜在消息的 PS、PL 和 CIC。PS 引入了额外的估计问题,因为消息是连续且高维的。无分布互信息下界受样本量限制,而变分估计器则在偏差与方差之间权衡\(McAllester and Stratos2020 (https://arxiv.org/html/2607.26773#bib.bib18); Pooleet al\.2019 (相似文章
超越标记:基于LLM的多智能体系统中潜在通信的统一框架
本文提出了一个基于LLM的多智能体系统中潜在通信的统一框架,按照通信信息内容、发送者-接收者对位和融合技术对方法进行分类,并回顾了2024至2026年间的十八种代表性方法。
见我所见,知我所想:异构智能体间的密集潜在通信
本文提出一种利用对齐的KV缓存变换在异构多智能体系统间进行密集潜在通信的方法,相比基于文本的方法,性能更优且计算成本更低。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
多智能体LLMs未能相互探索
本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。
多智能体LLM校准的反事实图
本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。