延迟验证破坏多智能体LLM信念:不稳定性阈值与最优校正器放置

arXiv cs.CL 论文

摘要

本文建模了多智能体LLM系统中延迟验证的影响,揭示了延迟校正会破坏共识稳定并引发振荡。它推导出闭式稳定性阈值,并提供了一种用于最优校正器放置的贪心近似算法,在五个开放模型上的实验验证了该结果。

arXiv:2606.27409v1 Announce Type: cross 摘要:多智能体大型语言模型(LLM)系统通常依赖验证器和批评者智能体来抑制幻觉,但验证存在延迟。在此延迟期间,虚假声明可能通过智能体网络传播。我们将此过程建模为带有接地校正器节点的图上的延迟共识。通过接地拉普拉斯算子的谱分解,得到了验证剂量的闭式稳定性阈值:校正过强或延迟过长都会使共识转变为振荡。最不稳定的情形发生在通信延迟与验证延迟相同时;对于延迟为2的情况,阈值为黄金比例的倒数。同一框架提供了一个超模放置目标,以及一个贪心(1-1/e)近似规则,用于将有限的校正器预算分配给有影响力的节点。在五个开放模型上的实验证实了预测的剂量-延迟振荡。相比之下,接地事实回答使真理成为吸收边界并消除了该效应,这表明不稳定性特定于符号信念任务,而接地验证仍保持稳定。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:26

# 延迟验证破坏多智能体LLM信念稳定性:失稳阈值与最优校正器部署  
来源:https://arxiv.org/html/2606.27409 \(2026年6月\)  

###### 摘要  

多智能体大语言模型(LLM)系统通常依赖验证器和批评智能体来抑制幻觉,但验证存在延迟。在此延迟期间,虚假声明可能通过智能体网络传播。我们将此过程建模为带有接地校正器节点的图上的延迟共识。通过接地拉普拉斯矩阵的谱分解,我们得到了验证剂量的闭式稳定性阈值:过强或过延迟的校正会将共识转化为振荡。最不稳定的情况发生在通信延迟与验证延迟重合时;当延迟为2时,阈值等于黄金比例的倒数。同一框架还给出了一个超模放置目标和一个贪心\(1−1/e\)近似规则,用于将有限的校正器预算分配给有影响力的节点。在五个开放模型上的实验验证了预测的剂量-延迟振荡现象。相比之下,基于事实的接地问答将真理设为*吸收*边界,消除了该效应,表明不稳定性特定于符号信念任务,而接地验证仍然保持稳定。  

关键词:多智能体LLM系统;幻觉级联;验证延迟;延迟稳定性;接地拉普拉斯矩阵;领导者选择;校正器部署。  

## 1 引言  

大语言模型会产生幻觉,而在多智能体系统中,幻觉不再是单个输出的静态属性,而变成了一个动态过程:声明被交换、修改并作为上下文重复使用,因此一个智能体提出的无依据声明可能被其他智能体放大\[2 (https://arxiv.org/html/2606.27409#bib.bib2),4 (https://arxiv.org/html/2606.27409#bib.bib4),3 (https://arxiv.org/html/2606.27409#bib.bib3)\]。即使在同一模型内部,这种现象也十分显著:Zhang等人表明,一旦LLM承诺了一个错误答案,它就会生成更多的虚假声明来为自己的错误辩护(“幻觉雪球效应”),即便该模型本身能够单独识别出这些声明是错误的\[7 (https://arxiv.org/html/2606.27409#bib.bib7)\]。标准缓解方法是添加验证器或批评智能体,它们负责对照证据检查声明,并将系统推回至事实真相\[8 (https://arxiv.org/html/2606.27409#bib.bib8),9 (https://arxiv.org/html/2606.27409#bib.bib9),10 (https://arxiv.org/html/2606.27409#bib.bib10),11 (https://arxiv.org/html/2606.27409#bib.bib11)\]。然而,验证存在延迟。验证器读取声明、检索证据,并在若干交互步骤之后才返回校正结果;在此期间,未经核实的声明已经传播出去。延迟的负反馈是控制系统产生振荡和不稳定的经典诱因,这引出了当前LLM智能体文献尚未提出的一个问题:*如果延迟,验证这一行为本身是否会破坏它本应保护的事实准确性?以及如何制定校正器的剂量和部署策略来避免这种情况?*  

智能体安全性研究正从事后分析转向级联的在线监控(因果跨通道监控\[20 (https://arxiv.org/html/2606.27409#bib.bib20)\]、在线故障审计\[19 (https://arxiv.org/html/2606.27409#bib.bib19)\]、时态图异常检测\[21 (https://arxiv.org/html/2606.27409#bib.bib21)\]),但这些方法只检测级联,没有对验证过程本身的闭环稳定性进行建模,也没有提供过去七十年快速变化检测理论所给出的检测延迟/剂量权衡\[25 (https://arxiv.org/html/2606.27409#bib.bib25),26 (https://arxiv.org/html/2606.27409#bib.bib26),27 (https://arxiv.org/html/2606.27409#bib.bib27),30 (https://arxiv.org/html/2606.27409#bib.bib30)\]。我们填补了这一缺失部分的动力学半边——验证回路的闭式剂量和延迟阈值——而单智能体信号的检测延迟与误报权衡则在我们合作的工作中处理\[36 (https://arxiv.org/html/2606.27409#bib.bib36)\]。我们的分析将近期用于自适应多智能体系统延迟制度监管的延迟诱发失稳框架\[35 (https://arxiv.org/html/2606.27409#bib.bib35)\]实例化到LLM验证回路中,其中纯滞后警报信号通过超临界Hopf分岔使原本稳定的平衡变得不稳定。与LLM交互最接近的动力学描述要么无延迟,要么仅限于单智能体:单调收敛的DeGroot式共识\[38 (https://arxiv.org/html/2606.27409#bib.bib38)\],由Chen等人提出的平均共识模型,其收敛由图谱设定\[52 (https://arxiv.org/html/2606.27409#bib.bib52)\],隐藏锚定 deliberation\[39 (https://arxiv.org/html/2606.27409#bib.bib39)\],作为反馈控制的单智能体自校正,具有静态稳定性阈值\[40 (https://arxiv.org/html/2606.27409#bib.bib40)\],以及一项实证性的多智能体事实性研究\[2 (https://arxiv.org/html/2606.27409#bib.bib2)\]。所有这些都未包含验证*延迟*;引入延迟及其诱导的振荡正是我们研究的切入点。多智能体辩论已被证实会退化,准确性下降,并难以超越单智能体基线\[53 (https://arxiv.org/html/2606.27409#bib.bib53)\]。但目前缺失的是对这种失败的*动力学*解释,而我们的阈值正好提供了这一点。  

本文有五项贡献。  

- •模型与约简。我们将带校正的多智能体回路建模为带有接地校正器的延迟共识,通过接地拉普拉斯矩阵解耦为独立的标量延迟递推关系(引理1 (https://arxiv.org/html/2606.27409#Thmlemma1);第3 (https://arxiv.org/html/2606.27409#S3)–4 (https://arxiv.org/html/2606.27409#S4)节)。  
- •验证剂量的闭式上限。当校正强度超过临界值时,回路不再收敛而是振荡;这个上限随着验证延迟增加而下降,在延迟为2时达到黄金比例的倒数(定理1 (https://arxiv.org/html/2606.27409#Thmtheorem1),命题2 (https://arxiv.org/html/2606.27409#Thmproposition2),引理2 (https://arxiv.org/html/2606.27409#Thmlemma2),推论1 (https://arxiv.org/html/2606.27409#Thmcorollary1);第4 (https://arxiv.org/html/2606.27409#S4)节)。  
- •最优校正器放置。真值追踪误差由一个预解式控制,其相干性是超模的,因此贪心规则可以在`1−1/e`的范围内接近最优地将有限的校正器预算分配到网络中的放大器和桥梁节点上(定理2 (https://arxiv.org/html/2606.27409#Thmtheorem2);第5 (https://arxiv.org/html/2606.27409#S5)节)。  
- •两种耦合延迟。信息传播延迟与验证延迟通过一个三项式稳定区域相互作用,其最坏情况是同步延迟角点,那里上限再次等于黄金比例的倒数(定理3 (https://arxiv.org/html/2606.27409#Thmtheorem3),推论3 (https://arxiv.org/html/2606.27409#Thmcorollary3);第6 (https://arxiv.org/html/2606.27409#S6)节)。  
- •经验性的制度二分法。预测的有符号剂量-延迟振荡出现在五个开放模型的真实数值估计辩论中,根据`βc(δ)`预先固定,无需拟合。相同的延迟使得基于事实的问答辩论保持收敛,因此不稳定性对符号信念来说是固有的,而非针对基于事实的问答(注1 (https://arxiv.org/html/2606.27409#Thmremark1);第7 (https://arxiv.org/html/2606.27409#S7)节)。  

## 2 相关工作  

本文处于两个很少交汇的文献领域之间(多智能体LLM系统可靠性的实证研究,以及延迟反馈的控制与检测理论研究),而反复出现的空白在于前者的研究中没有延迟/稳定性保证,后者尚未被应用于事实准确性验证。从LLM方面看,一个迅速发展的研究方向描述了错误如何在智能体之间产生和传播,但将这个过程视为静态的。Jamshidi等人追踪了智能体链中声明级别的不一致性,并报告了一个双向效应(更深的链降低了显式幻觉评分,却损害了事实准确性\[2 (https://arxiv.org/html/2606.27409#bib.bib2)\]),同时提供了一个集体幻觉模型,通过置信度加权聚合和选择性隔离来缓解\[3 (https://arxiv.org/html/2606.27409#bib.bib3)\];类似地,Xie等人表明,除非追踪来源,否则一个注入的错误就能使大多数框架完全“感染”\[4 (https://arxiv.org/html/2606.27409#bib.bib4)\],偏见和不安全内容也以同样方式传播\[5 (https://arxiv.org/html/2606.27409#bib.bib5),6 (https://arxiv.org/html/2606.27409#bib.bib6)\]。多智能体辩论可以提高事实准确性\[10 (https://arxiv.org/html/2606.27409#bib.bib10),11 (https://arxiv.org/html/2606.27409#bib.bib11)\],但同一文献也记录了其失败模式(思想退化与偏见评判\[12 (https://arxiv.org/html/2606.27409#bib.bib12)\],收益归因于多数投票而非辩论本身\[13 (https://arxiv.org/html/2606.27409#bib.bib13)\],以及准确性在轮次中*下降*,因为讨好共识\[14 (https://arxiv.org/html/2606.27409#bib.bib14)\]),而通信拓扑结构同时决定了准确性和成本\[15 (https://arxiv.org/html/2606.27409#bib.bib15)\]。在精神上最接近的是新兴的动力学系统路线:DeGroot共识,其分歧衰减速率由第二个图谱特征值设定\[38 (https://arxiv.org/html/2606.27409#bib.bib38)\];隐藏锚定 deliberation,可逃离初始凸包\[39 (https://arxiv.org/html/2606.27409#bib.bib39)\];以及单智能体自校正被重塑为带有静态阈值的反馈控制\[40 (https://arxiv.org/html/2606.27409#bib.bib40)\]。所有这些都是无延迟或单智能体的,因此根据它们假设的合作拓扑,这些模型要么单调收敛,要么停留在固定阈值上。即使没有延迟,通过有符号或结构不平衡的交互也可能产生振荡,但那是与我们不同的机制。离散延迟*平均*本身对延迟具有鲁棒性:其收敛由拓扑决定,而非延迟大小\[1 (https://arxiv.org/html/2606.27409#bib.bib1)\]。因此,我们研究的不稳定性的根源在于延迟的*校正器*,而非信息传播;先前没有任何模型包含这种验证*延迟*,而这正是我们相对于\[2 (https://arxiv.org/html/2606.27409#bib.bib2)\]的无延迟事实性递推关系的切入点。最后,在我们分析控制器时,有一项并行工作致力于构建*检测器*:事后归因于哪一步失败仍然困难(前沿模型的步骤定位准确率仅为`11%–41%`\[16 (https://arxiv.org/html/2606.27409#bib.bib16),17 (https://arxiv.org/html/2606.27409#bib.bib17),18 (https://arxiv.org/html/2606.27409#bib.bib18)\]),该领域正在转向在线监控,通过轨迹前缀审计\[19 (https://arxiv.org/html/2606.27409#bib.bib19)\]、跨通道因果影响监测级联的起始\[20 (https://arxiv.org/html/2606.27409#bib.bib20)\]以及时态图异常检测\[21 (https://arxiv.org/html/2606.27409#bib.bib21)\]。  

在控制与检测方面,我们所依据的骨干理论是序列变化检测(累积和统计量CUSUM\[25 (https://arxiv.org/html/2606.27409#bib.bib25)\], Shiryaev–Roberts统计量与最小最大理论\[26 (https://arxiv.org/html/2606.27409#bib.bib26),27 (https://arxiv.org/html/2606.27409#bib.bib27),28 (https://arxiv.org/html/2606.27409#bib.bib28),29 (https://arxiv.org/html/2606.27409#bib.bib29)\], 以及标准综述与专著\[30 (https://arxiv.org/html/2606.27409#bib.bib30),31 (https://arxiv.org/html/2606.27409#bib.bib31),32 (https://arxiv.org/html/2606.27409#bib.bib32)\]),再加上Kuruklis的离散延迟稳定性结果\[34 (https://arxiv.org/html/2606.27409#bib.bib34)\],我们的剂量边界是其特例。能够为这些检测器提供输入的单LLM信号,从语义熵\[22 (https://arxiv.org/html/2606.27409#bib.bib22)\]到SelfCheckGPT\[23 (https://arxiv.org/html/2606.27409#bib.bib23)\]以及更广泛的综述\[24 (https://arxiv.org/html/2606.27409#bib.bib24)\],现已成熟。只有两项LLM方面的工作直接涉及这一机制,且都未针对多智能体幻觉的起始:\[41 (https://arxiv.org/html/2606.27409#bib.bib41)\]首次将CUSUM应用于思维链,但目的是检测单模型置信度的*收敛*以便提前退出;而\[42 (https://arxiv.org/html/2606.27409#bib.bib42)\]将交互智能体建模为贝叶斯社会学习者,通过随机控制延迟羊群效应,但没有检测延迟界限;最接近的前身是我们自己的单模型幻觉*起始*建模,将其视为带有Lorden延迟界限的最快变化检测\[36 (https://arxiv.org/html/2606.27409#bib.bib36)\],而当前的多智能体延迟校正处理将其提升到网络层面。我们证明的放置结果,反过来,是经典网络控制理论的移植:接地拉普拉斯矩阵上的收敛误差相干性是超模的,从而得到贪心`(1−1/e)`领导者选择保证\[37 (https://arxiv.org/html/2606.27409#bib.bib37),44 (https://arxiv.org/html/2606.27409#bib.bib44),45 (https://arxiv.org/html/2606.27409#bib.bib45),47 (https://arxiv.org/html/2606.27409#bib.bib47)\],而LLM方面唯一的类比Sherlock\[43 (https://arxiv.org/html/2606.27409#bib.bib43)\]在预算限制下通过反事实启发式将验证器放置在流程图上,既无最优性保证也无稳定性分析。延迟轴也有控制先例:Pirani等人通过接地拉普拉斯矩阵谱刻画了领导者-跟随者共识的最大允许延迟裕度,并将其转化为领导者放置的集中性度量\[46 (https://arxiv.org/html/2606.27409#bib.bib46)\],但那是连续时间且只有单一延迟;我们增加了离散验证剂量、两种耦合延迟以及LLM回路。接地信号本身(声明验证与忠实性\[48 (https://arxiv.org/html/2606.27409#bib.bib48),49 (https://arxiv.org/html/2606.27409#bib.bib49)\])是标准的。  

## 3 模型  

我们将多智能体对话的一轮抽象如下。每个智能体持有关于某个声明的标量*信念*(即它对可能给出的答案的当前置信度),系统按轮次推进:智能体根据邻居的信念修正自己的信念(辩论),同时指定的*校正器*智能体(能够访问经过验证的证据)将信念推回事实真相。实际部署系统的两个特征驱动了动力学过程,并且是本文的重点。首先,校正是*延迟的*:验证器读取声明、检索证据,并在潜伏期之后才回复,因此它作用于过时的信念。其次,一些智能体是*故障的*:它们持有固定的错误信念,将其邻居拉离真相。因此,我们研究的问题表述为:给定交互图、验证延迟和故障强迫,(a)回路何时能将每个信念驱动到真相,何时反而会振荡?(b)有限的校正器预算应该部署在哪里以保持系统处于真相?本节其余部分将模型具体化;第4 (https://arxiv.org/html/2606.27409#S4)–6 (https://arxiv.org/html/2606.27409#S6)节回答(a),第5 (https://arxiv.org/html/2606.27409#S5)节回答(b)。  

设`G=(V,E)`为图,顶点集`V={1,...,n}`,具有对称拉普拉斯矩阵`L=D−A⪰0`。智能体`i`持有关于某个声明(其事实真相为`b⋆`)的标量信念`bi,t∈R`;误差为`ei,t=b`。

相似文章

多智能体LLM商议中的隐藏锚点

arXiv cs.AI

本文把多智能体LLM商议建模成一个闭环动力系统,其中每个智能体都拥有隐藏的内部信念(锚点),该锚点持续牵引其观点。文章展示了如何仅从商议数据中恢复这个锚点,并解释了诸如观点逃逸初始信念凸包等现象。

当代理过早承诺:诊断LLM代理的过早承诺

Hugging Face Daily Papers

本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。

The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents

arXiv cs.AI

Presents a verification instrument for long-horizon agents that structurally separates commitment drift from binding drift, using a deterministic executive and pre-registered predictions. Reports ablation results showing commitment mechanism removal flips goal abandonment from 0 to 1 while binding error stays flat, though task efficacy is null on ARC-AGI-3.