当规划正确执行却失败时:论基于LLM的多智能体系统的认知校准

arXiv cs.AI 论文

摘要

本文识别了基于LLM的多智能体系统中的一种失败模式,即由于智能体错误判断自身知识(认知校准不当)而导致规划失败,并提出EPC-AW工作流,通过信息一致性和认知状态细化将系统级成功率提升9.75%。

arXiv:2605.23414v1 公告类型:新 摘要:基于LLM的多智能体系统即使在计划动作执行正确时也可能失败,因为智能体在评估计划可行性时可能错误判断自身知识,我们将这种现象称为规划中的认知校准不当。与执行错误不同,认知校准不当在规划期间是潜在的,因为生成的计划可以保持自洽且可执行,没有可观察的错误;校准不当也是动态的,因为新信息可能改变可行性评估,可能掩盖过去的校准不当信号并导致其随时间复发。为解决此问题,我们提出了认知规划校准智能体工作流(EPC-AW),该工作流评估计划在不同信息条件下是否仍得到支持,而不是直接验证可行性。EPC-AW采用基于信息一致性的计划选择,选择评估跨智能体稳定的计划,并结合一致性引导的认知状态细化,通过利用过去的不一致性来指导未来规划,从而随时间调整校准。实验表明,EPC-AW平均将系统级成功率提升了9.75%。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:58

# 当正确执行仍导致规划失败:论基于LLM的多智能体系统的认知校准  
来源:https://arxiv.org/html/2605.23414  

###### 摘要  
基于LLM的多智能体系统即便在计划动作被正确执行时也可能失败,原因在于智能体在评估计划可行性时可能误判自身知识——我们将这种现象称为**规划中的认知失校**。与执行错误不同,认知失校在规划阶段是隐性的:生成的计划可能保持自洽且可执行,不产生可观测错误;同时,认知失校是动态的,因为新信息会改变可行性评估,可能掩盖过去的失校信号,并使其随时间反复出现。为解决此问题,我们提出**认知规划校准智能体工作流**(EPC-AW),该方法并非直接验证可行性,而是评估计划在不同信息条件下是否仍获得支持。EPC-AW 采用**基于信息一致性的计划选择**(IPS),选取在智能体间评价稳定的计划;同时结合**一致性引导的认知状态精炼**(CESR),通过利用过去的差异来指导未来规划,从而随时间适应性地进行校准。实验表明,EPC-AW 在系统级成功率上平均提升 9.75%。代码已开源在公共仓库(https://github.com/wzhSteve/EPC-AW)。  
机器学习,ICML  

## 1 引言  
基于大语言模型的多智能体系统已成为复杂决策、工具使用和长时任务执行的主流范式(Becattini 等,2025;Sun 等,2025;He 等,2025)。通过将任务分解到交互的智能体之间,此类系统实现了超越单智能体方法的可扩展问题求解能力(Becattini 等,2025;Ronanki,2025)。然而,尽管发展迅速,这些多智能体系统在实践中仍显脆弱,实际部署中失败频繁发生(Cemri 等,2025;Hammond 等,2025)。因此,诊断并纠正此类失败已成为构建可靠智能体系统的迫切需求(Liang 等,2025;Epperson 等,2025)。  

近期,越来越多的研究工作尝试通过干预系统运行的不同阶段来修复基于LLM的多智能体系统中的失败,包括事后方法和在线方法(Liang 等,2025;Ma 等,2025)。事后方法(Epperson 等,2025;Ma 等,2025)在任务失败后分析交互轨迹并应用回溯性修正;而在线方法(Liang 等,2025;Shen 等,2025)则在任务执行过程中监控错误累积,并在错误升级为任务失败前进行干预。在这些方法中,失败主要被归因于执行层面的错误,例如逻辑错误的工具输出或无效的工具返回(Zhang 等,2025b;Lu 等,2025;Reid 等,2025)。  

然而,实际部署揭示了一类无法仅用执行错误解释的失败。即便所有动作都按照既定计划正确执行,任务仍可能因计划本身相对于预期目标不可行而未能解决。这类失败源于规划阶段:计划编码了预期目标与实现所需动作之间的不匹配。例如,计划可能调用外部工具并收到有效响应,但未能为目标获取可验证的证据。这种情况发生在计划基于失校的可行性评估时,导致系统反复执行有效动作却始终无法满足目标。我们将这种失败模式定义为**规划中的认知失校**:规划智能体对可行性评估赋予了不当的自信,未能认识到自身知识在需要迭代信息获取的任务中的局限性。  

这一现象带来两个关键挑战。首先,认知失校是隐性的。与执行错误不同(执行错误表现为动作实现中的可观测错误或推理轨迹中的不一致性,如 Zhang 等,2025c;Cemri 等,2025),认知失校源于错误的可行性评估,不留下显式错误信号。因此,受认知失校影响的计划可能看起来自洽且可执行,使得这类失败在规划阶段特别难以检测。其次,认知失校是动态的。随着规划智能体持续获取新信息,其可行性评估不断演化,这会逐渐掩盖过去的失校信号,并导致失校随时间重复出现。虽然先前的方法利用动态反馈来纠正执行层面的错误(Ma 等,2025;Epperson 等,2025),但它们依赖可观测错误作为监督,因此无法处理计划层面的认知失校,限制了其在信息演化环境下保持校准的能力。  

为了缓解认知失校,我们提出**认知规划校准智能体工作流**(EPC-AW),这是一种针对多智能体协作的以规划为中心的工作流。EPC-AW 并不尝试直接验证计划可行性,而是关注计划在不同信息条件下是否仍获得智能体的支持。EPC-AW 包含两个互补组件。**基于信息一致性的计划选择**(IPS)在每个轮次内运行,作为规划时的诊断工具。IPS 不是检查计划是否被判断为可行,而是考察计划在拥有不同信息的智能体之间的评价是否稳定。那些在不同信息条件下评价差异显著的计划被视为认知上脆弱,而评价稳定的计划则被选中。**一致性引导的认知状态精炼**(CESR)跨轮次运行,通过记录规划智能体本地选择的计划与 IPS 选择计划之间的差异,将这些差异视为认知失校的信号。这些信号被整合到持久记忆中,从而约束后续规划,防止先前观察到的失校模式随着信息积累而再次出现。  

总之,EPC-AW 将失败缓解从执行时纠正转变为规划时认知校准。本文的主要贡献如下:  
- • 我们形式化了**规划中的认知失校**作为基于LLM的多智能体系统中的一个修复目标,揭示了即使执行正确,由失校的规划评估导致的失败。  
- • 为了在缺乏可观测错误的情况下处理规划评估中的认知失校,我们提出 IPS,它选择那些在异质信息条件下智能体间评价保持稳定的计划。  
- • 为了在信息演化下自适应认知校准,我们引入 CESR,一种内存驱动的机制,利用过去的校准误差来约束未来规划,抑制持续的错误判断。  
- • 在六个基于LLM的多智能体基准上的广泛实验表明,EPC-AW 显著提升了任务成功率,系统级成功率平均提升 9.75%。  

## 2 相关工作  

### 2.1 基于LLM的多智能体系统中的失败与修复  
基于LLM的多智能体系统越来越多地被用于复杂推理、工具使用和长时决策(Becattini 等,2025;Ronanki,2025;Li 等,2024),但它们仍然容易因推理错误、协调失败和信息使用不可靠而导致失败(Dobrovsky 等,2025;Hammond 等,2025;Zhang 等,2025a)。为了提高系统可靠性,先前的工作提出了通过分析运行期间或运行后的执行轨迹和智能体交互来诊断和修复失败的机制(Cemri 等,2026;Shen 等,2025;Epperson 等,2025;Ma 等,2025)。现有方法在何时以及如何应用修正上有所不同。一些方法通过检查交互轨迹或通过重复执行验证失败假设来进行事后或跨运行调试(Epperson 等,2025;Ma 等,2025)。另一些方法引入了在线监控和修正,例如执行过程中的回滚和反思(Liang 等,2025),或基于历史条件的异常检测与局部修复(Shen 等,2025)。尽管存在这些差异,大多数方法都侧重于在执行过程中纠正错误的动作或局部推理错误。相比之下,本工作将**规划中的认知失校**形式化为基于LLM的多智能体系统中一个独特的修复目标。它揭示了系统级失败可能源于规划时的失校可行性评估,即使所有后续执行在局部都是正确的。  

### 2.2 模型级与智能体级认知校准  
大语言模型中的认知校准已在过度自信和不确定性估计的背景下得到广泛研究(Abbasi Yadkori 等,2024;Lee 等,2025;Chhikara,2025)。这一研究方向将失校视为单个模型或智能体的属性,旨在使表达出的自信与实际知识对齐。一些方法利用多智能体结构通过共识、投票或批评中间输出的验证智能体来增强校准(Clark 等,2025;Wen 等,2024;Pitre 等,2025)。这些方法依赖LLM充当裁判,但此类一阶判断本身也受到认知失校的影响,限制了它们诊断认知失败的能力。另一相关研究方向借鉴了同伴预测和贝叶斯真值推断(Witkowski 和 Parkes,2012;Chen 等,2025),在静态博弈论假设下利用激励信号和重复反馈来校准报告。相比之下,我们研究的是运行中的基于LLM的多智能体系统中作为系统级失败模式的认知失校。我们的目标是通过在系统运行期间进行干预来修复任务失败,在此过程中没有额外的收益信号或外部监督。受基于同伴的校准方法启发,我们利用智能体在异质信息下评价的稳定性,并基于持续的跨智能体不一致性随时间精炼认知状态。更多细节见附录 G。  

## 3 问题形式化  

### 3.1 基于LLM的多智能体系统的运行  
一个基于LLM的多智能体系统记为 \mathcal{M},由多个通过结构化消息、共享内存和外部工具进行协调的交互智能体组成(Li 等,2026;Wu 等,2024)。给定用户查询 Q,系统旨在通过迭代规划、执行工具介导的动作并聚合新获取的信息来产生一个答案。在迭代 t 时刻,系统维护一个信息上下文 \mathcal{I}^{(t)},它聚合了用户查询、先前获取的证据以及交互历史。基于 \mathcal{I}^{(t)},一个规划智能体生成计划 \pi^{(t)} = (g^{(t)}, a^{(t)}),其中 g^{(t)} 表示一个中间目标,a^{(t)} 指定一个旨在通过可用工具(如网络搜索或代码执行)获取与 g^{(t)} 相关信息的具体动作。选中的动作被执行,得到一个观察或证据 e^{(t)},该证据通过聚合算子被纳入信息上下文:  
\mathcal{I}^{(t+1)} = \mathrm{D}(\mathcal{I}^{(t)}, \pi^{(t)}, e^{(t)}), \qquad (1)  
其中 \mathrm{D}(\cdot) 将新证据整合到现有上下文中。这个规划-执行循环持续进行,直到满足停止条件。系统的整体行为定义了一个从用户查询到最终答案的映射:  
\hat{Y} = \mathcal{M}(Q), \qquad (2)  
其中 \hat{Y} 表示对查询 Q 生成的答案。  

### 3.2 规划中的认知失校  
*规划中的认知失校* 指的是可行性评估的失败,即智能体对其判断赋予了不当的自信,未能认识到自身知识在需要迭代信息获取的任务中的局限性。设 \phi 表示任务的潜在事实情况,它原则上指定了证明一个计划所需的完整信息。这些信息不可直接观测,必须通过迭代交互获取。给定步骤 t 可用的信息 \mathcal{I}^{(t)},规划智能体隐含地确认了计划 \pi^{(t)} 的可行性。该主观可行性评估形式化为:  
J(\pi^{(t)} \mid \mathcal{I}^{(t)}). \qquad (3)  
其中 J(\cdot) 表示一个抽象判断函数,该评估反映了智能体在可用信息上下文 \mathcal{I}^{(t)} 下,对执行计划中动作 a^{(t)} 能否通过外部工具调用满足当前目标 g^{(t)} 的自信程度。相对地,计划 \pi^{(t)} 在潜在事实情况 \phi 下的客观可行性由下式刻画:  
E(\pi^{(t)} \mid \phi), \qquad (4)  
它指示了给定完整底层信息时,该计划原则上是否可以被证明合理。当智能体的

相似文章

多智能体LLMs未能相互探索

Hugging Face Daily Papers

本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。

多智能体LLM校准的反事实图

arXiv cs.CL

本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。

PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统

arXiv cs.AI

本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。

多智能体LLM安全中的操作重构与批准框架委托

arXiv cs.AI

本文引入了一种五条件控制对比设计,以区分多智能体LLM安全评估中操作重构、规划器行为和批准框架委托的影响,表明整体流水线安全度量不能解释为稳定的架构属性。