记忆与重加权:基于经验记忆与置信度估计增强多智能体辩论

arXiv cs.CL 论文

摘要

本文提出了R2-MAD,一个通过使用经验记忆和置信度估计来解决共享误解的框架,从而增强大型语言模型中的多智能体辩论,在基准测试中实现持续改进。

arXiv:2609.03619v1 Announce Type: new 摘要:多智能体辩论(MAD)通过让多个智能体通过讨论迭代地完善其响应,提高了大型语言模型的推理能力。然而,MAD存在一个关键漏洞,称为共享误解:当大多数智能体最初收敛于错误答案时,辩论过程往往会放大而非纠正错误。现有方法主要解决对等偏差,但未处理智能体固有的有偏见概念先验。为了缓解这一系统弱点,我们提出了R$^2$-MAD(记忆与重加权多智能体辩论),一个为智能体配备从过去辩论中积累的经验记忆的框架。R$^2$-MAD通过两个互补机制干预两种失败模式:一个辩论状态感知的检索策略基于当前共识水平检索相关历史证据,动态校准概念先验。然后,这些检索到的经验为估计每个智能体的可靠性提供了基础,产生置信度权重以调节对等影响。在各种基准测试上的实验表明,R$^2$-MAD相比现有的单智能体和MAD基线实现了持续改进。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:03

# 增强多智能体辩论:基于经验记忆与置信度估计
来源:https://arxiv.org/html/2609.03619

**玄发瑾**  
隶属机构:中国科学院自动化研究所  
隶属机构:中国科学院大学  
邮箱:[[email protected]](mailto:[email protected])

**马志健**  
隶属机构:中国科学院自动化研究所  
隶属机构:中国科学院大学  
邮箱:[[email protected]](mailto:[email protected])

**曾永成**  
隶属机构:中国科学院自动化研究所  
隶属机构:中国科学院大学  
邮箱:[[email protected]](mailto:[email protected])

**崔心雨**  
隶属机构:中国科学院自动化研究所  
隶属机构:中国科学院大学  
邮箱:[[email protected]](mailto:[email protected])

**张海峰**  
**王军**††通讯作者  
隶属机构:伦敦大学学院  
邮箱:[[email protected]](mailto:)

###### 摘要
多智能体辩论通过让多个智能体通过讨论迭代优化其回答,从而提升了大型语言模型的推理能力。然而,多智能体辩论存在一个被称为“共同误解”的关键漏洞:当大多数智能体最初都集中于一个错误答案时,辩论过程倾向于放大而非纠正错误。现有方法主要解决同伴偏差问题,但未解决智能体固有且有偏的概念先验问题。为缓解这一系统性缺陷,我们提出了R2-MAD(记住并重新加权的多智能体辩论)框架,该框架为智能体配备了从过往辩论中积累的经验记忆。R2-MAD通过两个互补机制干预两种失败模式:辩论状态感知检索策略通过检索与当前共识水平相关的历史证据,动态校准概念先验。随后,这些检索到的经验为评估每个智能体的可靠性提供了基础,生成置信度权重以调节同伴影响。在多个基准测试上的实验表明,R2-MAD相对于现有的单智能体和多智能体辩论基线方法取得了持续改进。

## 1 引言
多智能体辩论已成为提升大型语言模型推理能力的一种有前景的范式(Du et al., 2024;Liang et al., 2024)。通过让多个基于LLM的智能体迭代讨论并优化其回答,MAD在包括推理(Zhu et al., 2026;Ling et al., 2025)、评估(Chan et al., 2024)和问题求解(Li et al., 2025)在内的多项任务中,相比单智能体基线展现出持续的优势。其背后的基本直觉很有吸引力:多样化的智能体可以相互挑战彼此的错误,迭代优化推动整个群体趋向更好的答案。

然而,这种乐观图景掩盖了一个关键漏洞。当大多数智能体碰巧最初集中于同一个错误答案时(我们称之为“共同误解”),辩论过程不仅无法纠正错误,反而倾向于放大它。原本持有正确答案的智能体会逐渐被说服放弃自己的立场,转而支持多数人的共识。这种失败模式并非偶然异常,而是MAD框架的系统性弱点。为了缓解它,我们必须首先理解在这种情况下辩论为何失败,以及哪些因素导致了初始错误的放大。

最近的理论分析为回答这一问题提供了有益的见解。Estornell and Liu (2024) 表明,在潜在概念框架下,每个智能体在辩论中的生成可以分解为两个因素:**概念先验**(编码了智能体对正确答案的内在信念)和**同伴偏差**(捕捉其他智能体回答的累积影响)。在共同误解情况下,这两个因素相互叠加:先验已经偏向错误的概念,而同伴偏差以与同意智能体数量成比例的速率放大了这种偏差。这一分析提示了一个自然的设计原则:有效的缓解措施应同时干预这两个因素。但现有方法侧重于操纵其他智能体的回答以减少同伴偏差,而未解决有偏的先验问题。这激发了我们去探索能够同时校准先验和调节偏差的机制,我们发现过往辩论中的经验为两者提供了自然的基础。

基于此洞察,我们提出了R2-MAD,该框架为每个智能体配备了从过往辩论中积累的经验记忆。该记忆服务于两个互补的目的。首先,智能体检索相关经验以用历史证据校准其先验信念。检索由辩论状态感知策略引导,该策略适应当前的共识水平:当共识度高时,检索倾向于多样且具有对比性的经验来挑战多数方;当智能体仍存在分歧时,检索优先考虑与积极结果相关联的经验。其次,通过检查每个智能体的立场在历史相似情况下的表现,检索到的经验为评估每个智能体的可靠性提供了基础,然后用作置信度权重以在辩论期间调节同伴影响。这两种机制分别针对先验和偏差,并可在统一框架内自然结合。

我们在多个基准测试上评估了R2-MAD。实验结果表明,R2-MAD优于单智能体方法,并在现有MAD基线基础上取得了持续改进。消融实验证实,基于记忆的先验校正和置信度加权都对整体性能提升有所贡献。我们的主要贡献总结如下:(1)我们提出了R2-MAD,一个利用经验记忆干预概念先验和同伴偏差,以缓解多智能体辩论中共同误解的框架。(2)我们提供了补充性理论分析,扩展了现有的潜在概念分解框架以容纳记忆和置信度加权,为所提出的设计提供了形式化的理论依据。(3)我们在多个基准测试上进行了广泛的实验,证明了R2-MAD的有效性并验证了每个组件的贡献。代码已在https://github.com/KylJin/R2-MAD提供。

## 2 相关工作
#### 多智能体辩论
多智能体辩论框架利用多个基于LLM的智能体之间的协作互动来提升推理能力(Du et al., 2024)。遵循这一范式,先前的研究探讨了发散性辩论(Liang et al., 2024)、LLM作为裁判的评估(Chan et al., 2024)、高效通信结构(Li et al., 2024)以及其他应用(Chen et al., 2024b; Jin et al., 2024)。为了进一步提升辩论质量,已有多种方法被提出以优化智能体间的互动:多样性剪枝去除近似重复的回答以鼓励更广泛的探索(Estornell and Liu, 2024);选择性遮蔽过滤前一轮的不可靠消息以防止错误传播(Tian et al., 2026);FreeMaD用灵活的异步更新替代了严格的轮次制(Cui et al., 2025)。其他研究诊断了剩余的失败模式,包括未经校准的置信度表达和智能体多样性不足(Lin and Hooi, 2025; Zhu et al., 2026),以及代价高昂的消息传递促使了基于均衡的建模方法(Yi et al., 2025)。R2-MAD与这些努力互补,引入了跨辩论的视角,使用从过往辩论中积累的经验来校准智能体的信念和同伴影响。

#### 基于记忆的LLM智能体
记忆已成为LLM智能体的重要组成部分。先前的工作已使用记忆来存储观察和反思以实现更可信的长期行为(Park et al., 2023)、存储反馈用于迭代自我改进(Shinn et al., 2023)、存储从交互中获得的可重用技能(Wang et al., 2023)以及长期的用户或交互历史(Zhong et al., 2024; Packer et al., 2023)。除了存储过往交互,最近的记忆增强方法改进了记忆的检索、压缩和组织方式,范围从记忆启发式检索(Qian et al., 2024)和问题反思记忆(Wang et al., 2024a)到可逆压缩(Wang et al., 2025)和智能体级动态记忆组织(Xu et al., 2025)。在MAD领域,MAD-M2(Tian et al., 2026)尝试遮蔽前几轮辩论中的不可靠记忆以防止错误传播,而MeMAD(Ling et al., 2025)存储结构化的辩论记录并检索相关过往经验来指导未来的推理。与它们相比,R2-MAD进一步利用检索到的经验来评估每个智能体的可靠性以进行置信度加权,并根据不断演变的辩论状态动态调整其检索策略。

## 3 预备知识
#### 多智能体辩论框架
给定一个任务x及其目标答案y,多智能体辩论框架(Du et al., 2024)旨在利用n个基于LLM的智能体集体,在T轮内迭代地解决任务。设φ_i表示智能体i的参数(例如,模型权重、训练数据或先验上下文)。在初始轮t=0,每个智能体i独立地基于输入x生成一个回答z_i^{(0)}。在后续轮次(t>0),每个智能体i观察当前辩论状态,该状态定义为元组s_i^{(t)} := ⟨x, z_i^{(t-1)}, h^{(t-1)}, Cons(Z^{(t-1)})⟩,其中x是当前任务,z_i^{(t-1)}是智能体i的上一轮回答,h^{(t-1)}是上一轮辩论的自然语言摘要,Cons(Z^{(t-1)})是共识比例,定义为同意最热门答案的智能体比例:Cons(Z) = max_y (1/n) Σ_{i=1}^n 1[a(z_i) = y]。

#### 经验记忆
辩论结束后,每个智能体i将从每一轮t提取关键信息,构建记忆案例e_i^{(t)}并将其存储在其记忆库M_i中。具体而言,第t轮记忆案例e_i^{(t)}的结构形式化定义为:e_i^{(t)} := ⟨s_i^{(t)}, Z^{(t)}, y, ζ_i^{(t)}, r_i⟩。这里,Z^{(t)}是第t轮所有智能体的回答,y是任务x的答案,ζ_i^{(t)}表示智能体i当前回答的正确性,r_i是智能体i的结果奖励(1表示正确,0表示错误)。我们注意到,r_i只需要一个信号来表明一场结束的辩论是否达到了好的答案,任何从辩论结果中学习的方法必然需要这个信号。该信号并不绑定于标准标注:它同样可以由验证模型或针对可验证任务的执行反馈提供。在我们的实验中,它简单地重用了基准测试中已有的标签,除了数据集本身不需要额外标注。随着时间的推移,记忆库M_i积累了不断增长的辩论经验集合,可用于未来的辩论。

#### 检索策略
给定当前辩论状态s_i^{(t)}和记忆库M_i,状态感知检索策略分两阶段进行。假设要检索K个案例,我们首先通过计算s_i^{(t)}与记忆案例中辩论状态的余弦相似度,检索出前3K个案例,从而采样一个候选集C_i^{(t)}。然后我们通过最大边际相关性从C_i^{(t)}中选择K个案例,从E_i^{(t)} = ∅开始,在每一步贪婪地选择:e* = argmax_{e ∈ C_i^{(t)} \ E_i^{(t)}} [λ^t · sim(e, s_i^{(t)}) · r_i(e) - (1 - λ^t) max_{e' ∈ E_i^{(t)}} sim(e, e')],直到检索到的记忆集大小|E_i^{(t)}| = K。这里,r_i(e)是记忆案例e的结果奖励,折衷系数λ^t是共识比例的函数:λ^t = 1 - γ Cons(Z^{(t-1)}), γ ∈ [0, 1]。公式(7)中的第一项结合了相关性和结果质量:sim(e, s_i^{(t)}) · r_i(e)为语义相关且结果积极的经验赋予高分。第二项通过惩罚冗余来避免选择过于相似的经验。

相似文章

L-MAD:法律推理中多智能体辩论结构的系统性评估

arXiv cs.AI

本文介绍了L-MAD,一个用于系统性评估法律文本蕴含中多智能体辩论结构的框架。研究发现,增加智能体数量可提升准确率,但延长辩论轮次会导致有害的过度 deliberation 漂移,使得智能体互相强化错误,相较于单智能体基线最高提升8%。

潜在智能体:一种内化多智能体辩论的后训练方法

Hacker News Top

波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。

智能体的记忆尚未成熟

Reddit r/AI_Agents

对当前AI智能体记忆解决方案的批评,认为RAG包装器及类似方法未能解决模型偏见和上下文膨胀的核心问题。