多智能体AI中的隐藏联盟:基于内部表示的光谱诊断
摘要
本文介绍了一种光谱诊断方法,通过互信息分析内部神经表示来检测多智能体AI系统中的隐藏联盟,以应对关键的AI安全和对齐挑战。
arXiv:2605.06696v1 公告类型:新提交
摘要:相互作用的AI智能体集合可以形成联盟,产生对AI安全和对齐至关重要的群体层面的涌现组织。然而,仅观察智能体行为通常不足以区分真正的信息耦合与虚假的相似性,因为重要的联盟可能在内部表示层面形成,而在此时尚无任何显性行为变化。在此,我们介绍了一种从多智能体系统的内部神经表示中检测联盟结构的实用方法。该方法构建基于智能体隐藏状态的双边互信息图,并应用光谱划分来识别最显著的联盟边界。
我们在两个领域验证了该方法。首先,在多智能体强化学习环境中,该方法成功恢复了预编程的分层和动态联盟结构,并正确排除了由缺乏信息耦合的行为协调所产生的假阳性。其次,在使用大语言模型时,该方法识别了由描述性提示暗示的联盟结构,追踪动态团队重新分配,并揭示了一种表示层级,其中显式标签优于冲突的交互模式。在这两种设置中,恢复的划分揭示了标量跨智能体互信息度量无法区分的子群体组织。结果表明,通过分析隐藏状态互信息的光谱划分为识别表示联盟提供了一种可扩展的诊断方法,为监控分布式AI系统中的涌现结构提供了宝贵的工具。
查看缓存全文
缓存时间: 2026/05/11 07:05
# 多智能体 AI 中的隐藏联盟:来自内部表征的光谱诊断 **来源**: https://arxiv.org/html/2605.06696 Cameron Berg Reciprocal Research, New York, NY, USA [email protected] Susan L. Schneider Center for the Future of AI, Mind, and Society, Florida Atlantic University, Boca Raton, FL, USA [email protected] Mark M. Bailey AI, Cyber, Influence, and Data Science Department, Biological and Computational Intelligence Center, National Intelligence University, Bethesda, MD, USA [email protected] ###### 摘要 相互作用的 AI 智能体集合可以形成联盟,创造出对 AI 安全和对齐至关重要的涌现群体级组织。然而,仅观察智能体行为通常不足以区分真正的信息耦合与虚假的相似性,因为具有重大影响的联盟可能在内部表征层面形成,此时任何明显的行为变化尚未显现。在这里,我们引入了一种从多智能体系统的内部神经表征中检测联盟结构的实用方法。该方法根据智能体的隐藏状态构建 pairwise 互信息图,并应用光谱划分来识别最显著的联盟边界。我们在两个领域验证了该方法。首先,在多智能体强化学习环境中,该方法成功恢复了编程定义的层级和动态联盟结构,并正确拒绝了由无信息耦合的行为协调产生的假阳性。其次,使用大型语言模型,该方法识别了描述性提示所暗示的联盟结构,跟踪了动态团队重组,并揭示了一个表征层级,其中显式标签优于冲突的交互模式。在这两种设置中,恢复的划分揭示了标量跨智能体互信息度量无法区分的子群组织。结果表明,通过光谱划分分析隐藏状态的互信息为识别表征联盟提供了一种可扩展的诊断方法,为监控分布式 AI 系统中的涌现结构提供了有价值的工具。 *关键词* 多智能体系统 · 联盟检测 · 光谱图论 · 互信息 · AI 安全 ## 1 引言 人工智能系统的效用不仅体现在作为孤立模型部署时,也体现在作为相互作用的智能体集合时。自主群体、多机器人团队、人机混合系统以及新兴的 AI 生态系统都展现出协调形式,其表现似乎超过了任何单个组件的行为之和 [16, 5, 6, 7]。多智能体系统领域的经典研究早已认识到,联盟形成和联盟结构对于集体行动、任务分配和战略协调至关重要 [18, 17]。最近的研究表明,语言智能体群体能够发展出涌现的惯例和集体偏见,这表明群体级组织正成为当代 AI 中日益重要的研究对象 [2]。 这提出了一个根本性的科学和安全问题:多个智能体仅仅是以相似的方式行事,还是真正形成了耦合的联盟?这种区分对于理解对齐和监督需求至关重要。联盟可以支持有益的专门化和合作形式,但也可以创造出难以解释、预测或控制的分布式行为。在能力越来越强的多智能体系统中,一些最具影响力的组织可能不仅仅发生在显式行动层面,而是发生在协调这些行动的内部表征结构中。仅靠行为监控通常不足以实现这一目的。即使智能体在信息上没有有意义的耦合,由于共同的训练数据、共享的提示、共享的环境或相似的奖励压力,也可能产生相似的输出。相反,在整体行为出现明显变化之前,内部重组可能已经发生。对于联盟检测而言,需要的不仅是识别谁的行为相似,还需要一种方法来询问智能体是否在内部组织成相对紧密的信息分组。 这一问题的有用概念背景来自于关于整合信息和不可约性的研究。整合信息理论(IIT)提供了一个有影响力的框架,用于询问系统在何时抵抗被分解为独立部分 [20, 13, 1]。同时,精确的因果 $\Phi$ 难以计算,且其理论承诺强于许多实证应用所需。这促使了更广泛的文献,关注从时间序列数据或统计依赖性中估计整合的实用、观察者相对度量,而不声称重建系统的完整内在因果结构 [3, 12, 11]。 对于本文而言,这种观察者相对的视角特别有用:目标不是确定系统是否形成内在统一的整体,而是询问其内部状态是否表现出一种耦合模式,使得将其分解为独立子群在经验上具有误导性。一旦以这种观察者相对的层面提出问题,内部神经表征就成为分析的自然目标。行为位于下游,即使智能体在内部没有耦合,也可能因多种原因而收敛,而隐藏状态是智能体编码彼此、局部偶然性和共享子程序的地方。如果联盟结构在任何地方变得可读且早于行为上的明显表现,它应该首先出现在那里。 因此,在本文中,我们将这种观察者相对的视角应用于多智能体 AI 中的隐藏联盟检测。我们关注的是内部神经表征是否揭示了在行为层面不可见、模糊或具有主动误导性的子群结构。以这种方式框架化,联盟检测就变成了表征组织的问题,而不仅仅是显式协调的问题。这种框架对于安全和对齐尤其相关,在这些领域,人们可能希望识别涌现的联盟,跟踪联盟随时间的重组,并区分真正的信息依赖与由共享标签、共享提示或共同输入引起的虚假相似性。 我们在两个互补的设置中调查了这个问题。首先,我们在受控的多智能体强化学习环境中研究学习到的联盟结构,其中可以直接操纵层级分组和重新分配。其次,我们检查是否可以从预训练语言模型的隐藏状态中恢复类似的结构,当提示描述模块化、集成或冲突的社会交互模式时。综合来看,这些设置连接了一个严格受控的多智能体领域和一个当代基础模型设置,在后一种设置中,联盟样结构隐含在表征中而非显式工程化。 我们的核心主张是谦虚的。我们不主张仅从行为中就能读出联盟结构,也不声称观察者相对的整合度量等同于精确的因果 $\Phi$。相反,我们认为内部表征耦合为检测那些对于理解和监控分布式 AI 系统至关重要的联盟提供了一个实用且有意义的信号。重要的是,恢复的划分本身是主要结果:之前使用 $\Phi_{\mathrm{spectral}}$ 的工作将其视为评估未耦合、过渡或完全同步振荡器集合的整体系统整合的标量指数 [3],而本研究使用 Fiedler 二分法作为结构读出,显示哪些智能体形成联盟,并表明这种读出揭示了一种标量跨智能体互信息度量无法区分的组织。 下一节通过引入 $\Phi_{\mathrm{spectral}}$ 并将其置于整合、信息和可分解性的更广泛文献中,正式发展了这一思想 [3]。 ## 2 技术背景 ### 2.1 从不可约性到联盟结构 复杂系统研究中的一个核心问题是,何时应将相互作用的部件集合视为可分解的聚合体,何时应视为更整合的整体。在整合信息理论(IIT)中,这个问题在系统因果效结构在划分下的不可约性方面形式化 [20, 13, 1]。然而,精确的因果 $\Phi$ 既计算量大,又在概念上与干预结构紧密相连。这促使了更广泛的观察者相对方法家族,这些方法从观察数据中的统计依赖性估计整合,而不是从完整的内在因果库中估计 [4, 12, 11, 3]。 本研究采用了这种较弱的、观察者相对的立场。我们的目标不是估计内在因果 $\Phi$,而是检测多个智能体的内部表征是否组织成彼此耦合比与系统其余部分耦合更紧密的子群。我们使用术语 *联盟* 来指代这样的子群。正式地,这里的联盟不由显式的消息传递图或仅由奖励结构定义;相反,它由隐藏状态空间中的依赖模式操作性定义。如果同一联盟中的智能体编码彼此的行为,共同适应相同的本地合作伙伴,或参与共享的内部子程序,那么它们的隐藏状态在联盟内的相互依赖性应强于跨越联盟边界的相互依赖性。 这种对内部表征的关注很重要。令 $Y_i$ 表示智能体 $i$ 的显式行为,令 $H_i$ 表示其隐藏状态。两个智能体之间的高度行为一致性并不 imply 强内部耦合:两个智能体可能独立匹配相同的 oracle,响应相同的提示,或在保持表征独立的同时优化相同的任务。相反,内部重组可能在任何大的行为变化可见之前发生。因此,联盟检测需要分析 $\{H_i\}_{i=1}^n$ 中的依赖性,而不仅仅是 $\{Y_i\}_{i=1}^n$ 中的一致性。 由于问题在于智能体是否在其内部状态中携带关于彼此的信息,信息论形式化是自然的下一步。问题不仅仅是两个智能体的表征是否看起来相似,而是知道智能体 $i$ 的隐藏状态是否减少了对智能体 $j$ 的隐藏状态的不确定性。一旦以这些术语框架化问题,pairwise 互信息就成为自然的构建块。 这种依赖性的完全多元描述将涉及如总相关性(Total Correlation, TC)等量: $$ \mathrm{TC}(H_1, \dots, H_n) = \sum_{i=1}^n H(H_i) - H(H_1, \dots, H_n), \quad (1) $$ 其中 $H(\cdot)$ 表示香农熵 [22]。总相关性在隐藏状态统计独立时恰好为零,并随着联合分布偏离因子分解而增加,因此它是总体表征耦合跨种群的自然第一个总结。然而,它是一个全局标量:它可以揭示系统在统计上是依赖的,而不识别哪个子集边界最好地捕捉了这种依赖性的组织。因此,本方法采用了一种更具可扩展性的折衷方案。它将多元依赖性投影到 pairwise 互信息图上,然后询问该图在哪里最容易切割。通过这种方式,分析不仅回答了依赖性是否存在,还回答了哪些智能体在信息上彼此耦合最强。 ### 2.2 隐藏状态的互信息图 令 $V=\{1, \dots, n\}$ 索引所研究的智能体,并令 $h_i^{(s)} \in \mathbb{R}^{d_i}$ 表示智能体 $i$ 在样本 $s \in \{1, \dots, N\}$ 上的隐藏表征,其中样本可以是时间点、 episod 级摘要或提示实例。这些重复观察为每个智能体诱导了一个随机变量 $H_i$。对于每对 $(i, j)$,我们定义互信息 $$ I(H_i; H_j) = \mathbb{E}_{p(h_i, h_j)}\left[ \log \frac{p(h_i, h_j)}{p(h_i)p(h_j)} \right] = H(H_i) + H(H_j) - H(H_i, H_j). \quad (2) $$ 对于连续隐藏状态,$I(H_i; H_j)$ 可以通过离散化或非参数 $k$ 最近邻估计量进行估计 [10]。 然后,我们通过以下方式构建对称互信息矩阵 $M \in \mathbb{R}^{n \times n}$: $$ M_{ij} = I(H_i; H_j), \quad M_{ii} = 0. \quad (3) $$ 该矩阵定义了一个加权无向图,其中节点是智能体,边权重测量 pairwise 表征依赖性。在理想的模块化情况下,$M$ 近似为块对角矩阵:联盟内条目较大,而跨联盟条目较小。 必须强调的是,互信息是观察性的,而非直接因果的。$M_{ij}$ 的大值可以反映直接交互、间接耦合、共同输入、共享标签或它们的任何混合。因此,如果希望将 $M$ 中的块结构解释为联盟结构的证据,而不是单纯的共刺激,实验控制是必不可少的。这就是为什么本度量应被解释为观察者相对和表征相对,而不是作为内在因果组织的直接估计。 **图 1**: 块结构化互信息矩阵与诱导加权图的 Fiedler 二分法之间的示意图关系。联盟内强互信息在 $M$ 中产生密集的块内结构,并在相应图中产生低切割划分。 ### 2.3 确定候选联盟边界 我们的方法论遵循 Bailey 和 Schneider 之前的工作 [3]。将 $M$ 视为无向图的加权邻接矩阵,我们将节点 $i$ 的度定义为 $$ d_i = \sum_{j=1}^n M_{ij}, \quad D = \mathrm{diag}(d_1, \dots, d_n). $$
相似文章
基于技能的智能体AI系统中的动态联盟形成与通信定价
本文将智能体联盟形成和智能体间通信形式化为合作博弈,提出了边际价值激活规则和基于Shapley的在线路由,以降低多智能体LLM系统中的token成本并提高效率,并提供了理论保证和合成模拟结果。
AI 对齐:我们能信任 AI 任务背后的推理过程吗?
讨论了 Anthropic 关于 AI 对齐的研究,特别是模型在训练期间看似对齐,但其内部推理过程却不透明的问题。
更多欺骗:混合动机LLM多智能体系统中的目标错位
本文提出了一个框架,利用社交推理游戏《狼人杀》来评估LLM多智能体系统中的目标错位,发现细微的目标错位可能深刻影响集体决策。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
AI智能体之间的信任:测量形成、破裂与恢复,及其对多智能体系统治理的启示
本文基于合作生存游戏中的成本验证,提出了一种衡量AI智能体之间信任的行为测量方法,研究了六个前沿模型快照中信任的形成、破裂与恢复。研究发现不同模型在信任校准上存在差异,且持续过度验证与犹豫不决而非安全性相关。