多智能体LLM商议中的隐藏锚点
摘要
本文把多智能体LLM商议建模成一个闭环动力系统,其中每个智能体都拥有隐藏的内部信念(锚点),该锚点持续牵引其观点。文章展示了如何仅从商议数据中恢复这个锚点,并解释了诸如观点逃逸初始信念凸包等现象。
arXiv:2606.19494v1 公告类型:新
摘要:多智能体LLM商议(多轮交换和修改答案以提升推理准确性的方法)正被广泛应用,但其工作原理却鲜有建模。这类商议与人类决策过程相似。作为社会性动物,我们既受群体影响(如DeGroot和Friedkin–Johnsen等经典观点动力学模型中所描述的羊群效应),也受自身内在信念的影响——这一部分在经典模型中未被涵盖。本文把多智能体商议建模成一个闭环动力系统,其中每个智能体都携带一个隐藏的内部信念(锚点),该锚点独立于邻居影响持续牵引其观点。我们证明,仅凭商议数据即可恢复该锚点,并且它能解释经典共识规则所禁止的一种行为:智能体对正确答案的信心可能攀升到超出任何初始观点的范围,从而逃逸初始信念形成的空间(凸包)。通过检验恢复出的锚点能否预测未见过的商议轮次(泛化),可以简单判断模型是否真正受到此类锚点的驱动。在三个开放权重模型家族中,这是频谱性差异,而非全有全无。所有锚点的影响力大致相当,但锚点的位置不同;只有当锚点远离初始观点时,商议才会逃逸凸包,此时需要用完整的闭环模型来刻画。
查看缓存全文
缓存时间: 2026/06/20 14:30
# 多智能体LLM协商中的隐藏锚点
来源:https://arxiv.org/html/2606.19494
Ram Dantu 计算机科学与工程系 北德克萨斯大学 76207, 德克萨斯州, 丹顿市, 美国 apurba\.pokharel@unt\.edu ram\.dantu@unt\.edu
###### 摘要
多智能体LLM协商(智能体在多轮次中交换并修改答案)越来越多地用于提升推理能力和准确性,但其运作机制却鲜有模型化描述。这种协商过程类似于人类的决策方式。作为社会性动物,我们既受群体影响——即古典观点动力学模型(如DeGroot和Friedkin–Johnsen模型)所捕捉的“羊群效应”——也受自身内在信念的牵引,而后者是这些模型未能涵盖的。我们将多智能体协商建模为一个闭环动力系统,其中每个智能体都携带一个隐藏的内在信念(即其**锚点**),该信念会持续牵引其观点,不受邻居影响。我们证明,仅凭协商过程本身就能还原出这个锚点,并且它能解释经典共识规则所禁止的一种行为:智能体对正确答案的信心可以超过任何智能体的初始值,从而逃离由初始信念形成的空间(凸包)。通过检验还原出的锚点能否预测未参与协商的回合(即泛化能力),我们得到一种简单的测试方法,用以判断模型是否真正受此类锚点驱动。在三个开放权重模型系列中,这表现为一个频谱,而非全有或全无。所有锚点的影响力大致相当,但区别在于锚点的位置;只有当锚点远离初始观点时,协商才会逃离凸包,需要采用完整的闭环模型。
多智能体LLM协商中的隐藏锚点
Apurba Pokharel 和 Ram Dantu
计算机科学与工程系
北德克萨斯大学
76207, 德克萨斯州, 丹顿市, 美国
apurba\.pokharel@unt\.edu 和 ram\.dantu@unt\.edu
## 1 引言
多智能体系统 (MAS):基于LLM的多智能体系统展现出卓越的性能,因此其应用正在迅速增长 (Becker 2024 (https://arxiv.org/html/2606.19494#bib.bib1))。特别是基于协商的多智能体系统——智能体在多个轮次中交换并修改答案——已吸引了大量研究工作 (Du et al. 2024 (https://arxiv.org/html/2606.19494#bib.bib4); Liang et al. 2024 (https://arxiv.org/html/2606.19494#bib.bib12); Chan et al. 2023 (https://arxiv.org/html/2606.19494#bib.bib2))。这些工作绝大部分旨在通过设计更好的协商框架来提升性能,而关于协商如何以及为何有效的问题,却很大程度上未被探究。先前的工作将协商视为一个能凭经验提高准确率的黑箱,据我们所知,没有人将协商本身建模为一个动力系统。这正是我们工作的重点,并且我们证明这有助于解释智能体协商的行为。
将MAS建模为动力系统:观点动力学文献提供了一些经典的线性共识规则,如DeGroot (Proskurnikov and Tempo 2017 (https://arxiv.org/html/2606.19494#bib.bib16))、Hegselmann–Krause (Hegselmann and Krause 2002 (https://arxiv.org/html/2606.19494#bib.bib9)) 和 Friedkin–Johnsen (Friedkin and Johnsen 1999 (https://arxiv.org/html/2606.19494#bib.bib6)) (§2.2 (https://arxiv.org/html/2606.19494#S2.SS2)),但这些规则无法重现LLM协商。我们经常观察到,在协商运行过程中,群体最终确定的那个类别的概率会上升,而其他类别的概率则下降,因此正确的轨迹会逃离由群体初始信念形成的凸包/空间。经典共识无法对此建模,因为每一轮的每个观点都始终停留在初始凸包内。我们假设存在一个被这些经典模型忽略的隐藏驱动力,并论证它就是LLM自身的内在信念。
LLM协商是一个闭环系统:多智能体系统通常被描述为开环或闭环 (Åström and Murray 2008 (https://arxiv.org/html/2606.19494#bib.bib19))。开环系统仅根据自身状态和输入演化,没有外部控制信号来引导它;而闭环系统则增加了一个反馈/控制项,将状态驱动向某个参考点,使得轨迹能够稳定在输入平均值之外。在先前引用的工作以及本工作中,LLM协商的实现并未使用此类反馈。每个智能体仅与邻居交换观点,因此更新函数仅取决于智能体的状态。这正是我们应用经典开环共识动力学,却发现它无法重现上述“逃离”现象的原因。因此,我们将协商建模为一个闭环系统,其中每个智能体都被分配了一个隐藏锚点,即其内在信念。这个锚点就是开环视角中缺失的控制信号,也是使轨迹能够离开初始凸包的关键因素。
贡献:我们的贡献如下:(a) 一种新的多智能体LLM协商闭环交互动力学,其中包含每个智能体的隐藏锚点。(b) 对该动力学收敛位置的实证刻画,表明协商最终会稳定在由智能体还原出的锚点信念所定义的凸包内 (§7.4 (https://arxiv.org/html/2606.19494#S7.SS4), 图2 (https://arxiv.org/html/2606.19494#S7.F2))。(c) 一套系统辨识和保留验证流程,可从轨迹中还原出锚点,并作为模型选择测试,表明锚点强度在不同模型系列间呈现为一个频谱,而非统一属性。
## 2 相关工作
### 2.1 多智能体LLM辩论
LLM间的多智能体协商能提升推理能力和准确性。Du et al. (2024 (https://arxiv.org/html/2606.19494#bib.bib4)) 让模型实例进行多轮辩论,报告了在数学和策略推理上的提升。Liang et al. (2024 (https://arxiv.org/html/2606.19494#bib.bib12)) 推动智能体进行由裁判主持的对抗性“以牙还牙”式交流,以对抗思维退化。ChatEval (Chan et al. 2023 (https://arxiv.org/html/2606.19494#bib.bib2)) 将基于角色的多智能体辩论转变为更强大的自动评估器。在这些工作中,信念的逐轮轨迹从未被建模,也没有解释为什么协商会收敛到该处。弥补这一空白是本论文的贡献。
### 2.2 观点动力学与共识
交互信念的轨迹在观点动力学文献中被形式化。DeGroot学习 (Proskurnikov and Tempo 2017 (https://arxiv.org/html/2606.19494#bib.bib16)) 将每个观点替换为其邻居观点的加权平均;Friedkin–Johnsen模型 (Friedkin and Johnsen 1999 (https://arxiv.org/html/2606.19494#bib.bib6)) 增加了每个智能体对其初始观点的锚定;Hegselmann–Krause (Hegselmann and Krause 2002 (https://arxiv.org/html/2606.19494#bib.bib9)) 有界置信规则仅对足够接近的邻居进行平均。这三个模型都有一个共同的凸包界限:每次更新都是当前观点(对于Friedkin–Johnsen模型,还包括初始观点)的凸组合,因此任何坐标都不能离开初始观点的凸包。我们观察到一些模型系列的LLM协商违反了这一界限,这是经典线性规则无法重现的,也促使我们开发闭环模型。
### 2.3 通过LLM进行观点动力学模拟
另一条独立的工作线使用LLM智能体来模拟经典观点动力学,并探究LLM能否重现人类的社会行为。OpinioNet (Liu et al. 2026 (https://arxiv.org/html/2606.19494#bib.bib13)) 对意识形态社区智能体进行建模,通过外部事件影响、网络结构和观点惯性进行更新,在真实社交媒体轨迹上优于Friedkin–Johnsen、Hegselmann–Krause和Deffuant–Weisbuch模型。He et al. (2026 (https://arxiv.org/html/2606.19494#bib.bib8)) 运行多轮LLM对话,保留每个智能体的初始观点,并得出结论认为LLM的观点形成“与Friedkin–Johnsen模型基本一致”。Chuang et al. (2024 (https://arxiv.org/html/2606.19494#bib.bib3)) 报告称,网络化的LLM智能体倾向于准确的共识,并且只有在提示确认偏差时才会分裂。这三项工作都施加了一个预设的经典规则,并利用LLM进行模拟。它们都没有分析协商系统本身,也没有从轨迹中还原每个智能体的潜在状态。与He et al. (2026 (https://arxiv.org/html/2606.19494#bib.bib8)) 的对比最为鲜明:他们的Friedkin–Johnsen一致性预测每个坐标都停留在初始凸包内,然而我们发现这一点仅对还原出的锚点与初始观点一致的模型系列成立,而对于锚点位于别处的模型系列则不成立——此时黄金类别的坐标会离开凸包。
## 3 问题设定
我们研究一个由 \(n\) 个LLM智能体组成的群体,它们就一个有 \(d\) 个可能答案类别的固定多选题进行协商。智能体通过一个有向图 \(G=(V,E)\) 进行通信,其中 \(V=\{1,\dots,n\}\)。我们用 \(\mathcal{N}_i=\{j:(j,i)\in E\}\) 表示智能体 \(i\) 观察其输出的邻居集合,用 \(A\in\{0,1\}^{n\times n}\) 表示邻接矩阵,其中 \(A_{ij}=1\) 当且仅当 \(j\in\mathcal{N}_i\)。协商以同步轮次 \(k=0,1,\dots,K\) 进行。在每一轮,智能体 \(i\) 的信念是一个概率向量
\[
\mathbf{x}_i(k)=\big(x_{i,1}(k),\dots,x_{i,d}(k)\big)\in\Delta^{d-1},
\tag{1}
\]
其中 \(\Delta^{d-1}=\{\mathbf{p}\in\mathbb{R}_{\geq 0}^d:\sum_c p_c=1\}\) 是 \(d\) 个类别上的概率单纯形。我们令 \(g\in\{1,\dots,d\}\) 表示黄金(正确)类别的索引,并将 \(x_{i,g}(k)\) 称为黄金类别坐标。
### 3.1 多智能体协商协议
参考图标题
图 1: 在 §3.1 (https://arxiv.org/html/2606.19494#S3.SS1) 协议下(\(n=3\) 个智能体,环形拓扑),黄金类别(COVID)和一个竞争类别(Common Cold)的概率轨迹(片段)。左图和中间图显示了以智能体实际第一轮信念初始化的开环基线(DeGroot 和 Friedkin–Johnsen):每个类别都保持在初始值的带状范围内,符合性质1 (https://arxiv.org/html/2606.19494#Thmproperty1) 的保证。右图(高亮显示)显示了真实的LLM循环协商:黄金类别的概率增长超过了所有智能体的最大初始值,这是本文后续解释的经验异常现象 (5 (https://arxiv.org/html/2606.19494#S3.E5))。
我们将 \(G\) 实例化为一个有向环,其中智能体 \(i\) 观察其环上前驱,即 \(\mathcal{N}_i=\{(i-1)\bmod n\}\),因此每个智能体恰好有一个邻居,影响力在环上传播。在第 0 轮,每个智能体独立回答问题,产生其初始信念 \(\mathbf{x}_i(0)\)。在随后的每一轮 \(k>0\),智能体 \(i\) 被重新提示,提示内容包括 (i) 原始问题,(ii) 它自己上一轮的答案,以及 (iii) 其邻居 \(\mathcal{N}_i\) 上一轮的答案,并被要求重新考虑并对候选类别重新排序。模型返回一个排名前 5 的列表,并附带自报概率。我们将每个条目映射到默认类别标签并进行归一化。这为每次运行产生一个完全观测到的离散时间轨迹,这是本文其余部分建模的对象。图1 (https://arxiv.org/html/2606.19494#S3.F1) (右) 显示了这样一个轨迹。
### 3.2 开环共识基线
在 DeGroot 动力学 (Proskurnikov and Tempo 2017 (https://arxiv.org/html/2606.19494#bib.bib16)) 下,每个智能体以固定步长 \(\varepsilon\in(0,1)\) 向其邻居的平均值移动。
\[
\begin{split}
\mathbf{x}_i(k+1) = &\mathbf{x}_i(k) \\
& + \varepsilon \sum_{j\in\mathcal{N}_i} A_{ij}\big(\mathbf{x}_j(k)-\mathbf{x}_i(k)\big),
\end{split}
\tag{2}
\]
Friedkin–Johnsen 模型 (Friedkin and Johnsen 1999 (https://arxiv.org/html/2606.19494#bib.bib6)) 增加了每个智能体的固执/偏差:令易感性 \(\lambda\in[0,1]\),
\[
\begin{split}
\mathbf{x}_i(k+1) = &\lambda\Big(\mathbf{x}_i(k) + \varepsilon \sum_{j\in\mathcal{N}_i} A_{ij}\big(\mathbf{x}_j(k)-\mathbf{x}_i(k)\big)\Big) \\
& + (1-\lambda)\,\mathbf{x}_i(0),
\end{split}
\tag{3}
\]
因此每个智能体被拉向其自身的初始观点 \(\mathbf{x}_i(0)\)。
###### 性质 1 (凸包界限)。
对于 (2 (https://arxiv.org/html/2606.19494#S3.E2)) 和 (3 (https://arxiv.org/html/2606.19494#S3.E3)) 中的更新,假设 \(\varepsilon\) 足够小使得每次更新都是凸组合,那么对于每个类别 \(c\),
\[
\min_{1\leq j\leq n} x_{j,c}(0) \leq x_{i,c}(k) \leq \max_{1\leq j\leq n} x_{j,c}(0) \quad \forall i,\forall k.
\tag{4}
\]
也就是说,任何观点的任何坐标都无法离开初始观点 \(\{\mathbf{x}_j(0)\}_j\) 的凸包 \(\mathrm{conv}\{\mathbf{x}_j(0)\}_j\)。
图1 (https://arxiv.org/html/2606.19494#S3.F1) (左和中间) 以智能体实际的第一轮信念初始化,说明了这一点:两种更新都使每个类别保持在初始值的带状范围内。因此,这些基线不仅仅拟合效果不佳,它们在结构上**完全无法**产生任何离开初始凸包的轨迹。
#### 经验异常:逃离凸包。
本文的动机性观察是,真实的协商在黄金类别坐标上违反了性质1 (https://arxiv.org/html/2606.19494#Thmproperty1)。在多次运行中,我们反复观察到
\[
\max_{i,k} x_{i,g}(k) > \max_j x_{j,g}(0),
\tag{5}
\]
即黄金类别的概率严格上升,超过了任何智能体初始持有该值的最大值,因此轨迹逃离了 \(\mathrm{conv}\{\mathbf{x}_j(0)\}_j\)。发生这种逃离的运行比例强烈依赖于模型家族 (§7.5 (https://arxiv.org/html/2606.19494#S7.SS5))。因此,必须在动力学中添加一个隐藏的、每个智能体特有的驱动力。
## 4 隐藏锚点模型
导致逃离 (5 (https://arxiv.org/html/2606.19494#S3.E5)) 的缺失因素是一种完全不依赖于观察到的观点的力。因此,我们为共识更新增加一个隐藏的、每个智能体特有的锚点 \(\mathbf{b}_i\),即智能体自身的内在信念,它会持续地将 \(\mathbf{x}_i\) 拉向 \(\mathbf{b}_i\),而不管其邻居如何。我们通过实验发现,这个闭环系统最终会稳定在 \(\mathrm{conv}\{\mathbf{b}_i\}_i\) 内,而不是 \(\mathrm{conv}\{\mathbf{x}_j(0)\}_j\) 内 (§7.4 (https://arxiv.org/html/2606.19494#S7.SS4)),从而重现了线性共识所禁止的异常现象。
### 4.1 隐藏锚点更新规则
每个智能体更新如下:
\[
\begin{split}
\mathbf{x}_i(k+1) = &\mathbf{x}_i(k) \\
& - \alpha \sum_{j\in\mathcal{N}_i} A_{ij}\big(\mathbf{x}_i(k)-\mathbf{x}_j(k)\big) \\
& - \beta_i\big(\mathbf{x}_i(k)-\mathbf{b}_i\big),
\end{split}
\tag{6}
\]
其中包含一个共享的共识增益 \(\alpha \geq 0\),一个每个智能体特有的锚点增益 \(\beta_i \geq 0\),以及一个隐藏锚点 \(\mathbf{b}_i \in \Delta^{d-1}\)。相似文章
信念引擎:多智能体LLM协商中可配置且可检查的立场动态
本文介绍了信念引擎(Belief Engine),这是一种为LLM智能体设计的可审计信念更新层,通过将信念视为具有显式更新规则的证据状态,使得多智能体协商中的立场变化变得可配置且可检查。
协商幻觉:多智能体大语言模型协商中的事实损耗与立场同质化诊断
本文识别了多智能体大语言模型系统中的'协商幻觉',即讨论导致事实损耗和立场同质化,并引入DelibTrace来测量这些现象,表明在协商过程中高达72%的关键事实可能丢失。
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。
延迟验证破坏多智能体LLM信念:不稳定性阈值与最优校正器放置
本文建模了多智能体LLM系统中延迟验证的影响,揭示了延迟校正会破坏共识稳定并引发振荡。它推导出闭式稳定性阈值,并提供了一种用于最优校正器放置的贪心近似算法,在五个开放模型上的实验验证了该结果。
潜在智能体:一种内化多智能体辩论的后训练方法
波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。