辩论者的混合体:在多智能体推理中学习架构层面的辩论
摘要
提出一种辩论者混合(MoD)框架,利用混合专家模型实现单个LLM内的动态自我辩论,在显著降低延迟和令牌消耗的同时实现更优的准确率。
arXiv:2606.29425v1 公告类型:新
摘要:现有的多智能体辩论框架存在两个关键局限:一是依赖静态架构,智能体角色和协调模式在设计时固定;二是需要实例化多个模型副本,带来大量计算开销。我们提出辩论者混合(MoD),一种统一框架,通过利用混合专家范式实现单个模型内的动态自我辩论。我们解决了将MoE适配于辩证推理的三大挑战:(1)双路由——将角色分配与流程解耦,动态决定何时辩论、何时综合;(2)动量切换——利用局部上下文平滑令牌级路由,减少专家切换抖动;(3)统一自我辩论——将多种辩论角色封装为轻量级专家模块,在保持行为多样性的同时消除智能体间通信。在多模态基准上的广泛实验表明,MoD在性能上优于单模型基线和传统多智能体系统,以3.7倍更低的延迟和87%的令牌消耗缩减实现了更优的准确率。源代码可通过 https://github.com/YongLD/MoD 获取。
查看缓存全文
缓存时间: 2026/06/30 05:33
# 辩论者混合:在多智能体推理中实现架构层面的辩论学习 来源:https://arxiv.org/html/2606.29425 ###### 摘要。现有的多智能体辩论框架存在两个关键局限:它们依赖于静态架构,其中智能体角色和协调模式在设计时即被固定;并且需要实例化多个模型副本,带来巨大的计算开销。我们提出**辩论者混合(Mixture of Debaters, MoD)**,一个统一的框架,通过利用混合专家(MoE)范式,在单个模型内实现动态的自我辩论。我们解决了将MoE应用于辩证推理的三个关键挑战:(1) **双重路由(dual-routing)**,将角色分配与流程控制解耦,动态决定何时辩论以及何时综合;(2) **动量切换(momentum switching)**,利用局部上下文平滑令牌级路由,减少专家切换抖动;(3) **统一自我辩论(unified self-debate)**,将多样化的辩论角色封装到轻量级专家模块中,在保持行为多样性的同时消除智能体间通信。在多模态基准上的广泛实验表明,MoD 优于单模型基线和传统的多智能体系统,在实现更高准确率的同时,延迟降低了 3.7 倍,令牌消耗减少了 87%。源代码可在 https://github.com/YongLD/MoD 获取。 多智能体,自我辩论,混合专家,多模态推理 ††isbn:978-1-4503-XXXX-X/2026/06††ccs:计算方法 自然语言处理††ccs:计算方法 神经网络††ccs:计算方法 计算机视觉††ccs:计算方法 知识表示与推理 ## 1. 引言 大型语言模型(LLM)在复杂推理任务中展现了卓越的能力,这些任务涵盖从数学问题求解到逻辑演绎和代码生成(Didolkaret al., 2024; Seals and Shalin, 2024; Weiet al., 2022; Penget al., 2025)。尽管像思维链(CoT)这样的提示策略取得了成功,但单个整体模型生成的推理轨迹仍然容易出现退化和幻觉,尤其是在处理复杂的逻辑场景时(Zheng and Li, 2026)。为了克服这些局限,近期的研究转向了多智能体辩论框架,其中多样化的智能体通过对抗性批评和交叉审问来提高推理的保真度(Lianget al., 2024; Liet al., 2025b; Zhenget al., 2024)。 请参见图注。内部与外部辩论架构。(A) 传统的多智能体辩论需要实例化独立的模型副本 ($A_1$–$A_4$),这会带来巨大的运行时复杂度。(B) 我们的辩论者混合将多样化的智能体内化到一个共享的专家池中,并采用动态路由,提高了框架灵活性,同时消除了智能体间通信开销。 图 1. 内部与外部辩论架构。(A) 传统的多智能体辩论需要实例化独立的模型副本 ($A_1$–$A_4$),这会带来巨大的运行时复杂度。(B) 我们的辩论者混合将多样化的智能体内化到一个共享的专家池中,并采用动态路由,提高了框架灵活性,同时消除了智能体间通信开销。 然而,我们认为当前的辩论范式在结构上受到限制。现有系统采用静态架构运作,其中智能体角色和通信模式在设计时即被固定。例如,一个标准设置可能会严格强制执行“提出→批评→改进”的循环。然而,现实世界的多模态问题是流动且多方面的:一个高级物理问题最初可能看起来像一个简单的运动学问题,在仔细检查图表后演变成一个复杂的热力学难题,并最终需要数学综合。在这种动态上下文中,固定的拓扑结构无法适应问题不断变化的认知需求。 为了弥合静态架构与流动推理需求之间的差距,混合专家(MoE)框架提供了一个有前景的结构基础(Zhouet al., 2022; Liuet al., 2023b; Liet al., 2024b)。通过根据输入动态激活不同的参数子集(专家),MoE 有潜力实现稳健且泛化的推理。然而,将通用的 MoE 架构直接应用于辩论的辩证过程并非易事,并且暴露了明显的架构差距。 在这项工作中,我们提出了**辩论者混合(Mixture-of-Debaters, MoD)**,一个将动态自我辩论统一在单一架构内的试点框架。我们通过识别将 MoE 应用于辩论的三个关键挑战,并展示我们相应的架构优势来阐述我们的贡献: * **用于辩证流程控制的双重路由。** 标准的 MoE 架构通常依赖单个路由器将令牌分派给专家。这种设计不足以支持辩论,因为辩论需要跨不同维度进行编排:分配特定的*角色*(例如,提议者与批评者)和管理*流程*(例如,辩论与总结)。单个路由器无法同时优化这些正交目标。我们提出了一种双重路由机制,将角色分配与阶段管理解耦。通过引入专门的门控函数,我们的模型动态地调节何时进行辩论(调用辩证对抗)以及何时进行总结(调用综合)。这使得系统能够自适应地切换策略,对简单子问题跳过不必要的论证,或提前调用综合来解决冲突,从而优化推理轨迹。 * **用于一致性的动量切换。** 传统的 MoE 门控在令牌级别运行,对局部噪声和微小的表示波动敏感。在辩论上下文中,这种不稳定的路由可能导致过频繁地交换专家(例如,在短时间内于“支持”和“批评”立场之间切换),从而碎片化推理轨迹并损害连贯性。我们引入了**动量切换(Momentum Switching)**,通过局部上下文聚合来平滑路由决策,使得专家使用随时间更渐进地演变,从而改善短程持续性,同时仍能对真实的上下文变化做出响应。这种稳定化是轻量级的,与自回归模型兼容,并通过减少多轮推理中不必要的角色翻转来补充我们的双重路由设计。 * **统一高效的自我辩论。** 先前的多智能体辩论框架依赖于实例化多个不同的模型或维护 LLM 的多个重型副本来模拟交互。这种模型间通信计算成本高、内存密集,并且由于网络开销或上下文切换而引入显著的延迟。我们提出了一种基于 MoE 架构的统一自我辩论模式。通过将多样化的辩论角色封装到*单一*主干网络内的轻量级、专门化的专家模块中,我们消除了外部多模型编排的需要。这种设计降低了智能体间通信成本,同时保留了有效自我辩论所需的行为多样性,从而在紧凑的计算预算内实现高效、高质量的推理。 请参见图注。辩论者混合(MoD)概览。左:视角转换数据合成从正确和错误样本构建用于信念修正的辩论轨迹。右:MoD 架构,包含双重路由、动量切换以及解耦的 A 侧/B 侧专家池,用于多样的推理路径。 图 2. 辩论者混合(MoD)概览。左:视角转换数据合成从正确和错误样本构建用于信念修正的辩论轨迹。右:MoD 架构,包含双重路由、动量切换以及解耦的 A 侧/B 侧专家池,用于多样的推理路径。 ## 2. 相关工作 **多智能体推理与辩论。** 多智能体辩论已成为一种有效的范式,通过对抗性批评和交叉审问来暴露潜在的不一致性,从而提高推理能力(Zhanget al., 2025b; Lianget al., 2024; Boet al., 2024)。近期的研究将此想法扩展到多模态设置,表明多个视觉语言智能体之间的交互可以提高推理的可靠性并减少幻觉(Yuet al., 2024; Lianget al., 2025a, 2026; Huet al., 2025; Zheng, 2025)。这一研究方向被智能体混合(Mixture-of-Agents, MoA)进一步泛化,它通过分层协调聚合来自多个外部模型的响应(Wanget al., 2024a)。尽管有效,但这些方法通常需要多个模型实例或外部 API 作为独立智能体,导致巨大的内存、通信和延迟开销。此外,它们的性能通常依赖于底层模型的零样本辩论能力,当基础模型较弱或倾向于浅层矛盾和同义反复时,这种优势可能会受限(Subramaniamet al., 2025; Choiet al., 2025)。 **内省式审议与自我修正。** 为了降低显式多智能体编排的成本,另一条平行的工作线试图在单个模型内部化审议行为。早期的努力如 Debate, Reflect, and Distill (DRD) 将多智能体辩论轨迹蒸馏到学生模型中(Zhouet al., 2025),而 SMoA 则使用单个 LLM 生成多个候选响应来模拟 MoA 风格的聚合(Liet al., 2025a)。近期的研究越来越多地转向直接加强自我批评和自我修正。例如,S2R 通过轻量级监督和强化学习教会模型在推理过程中自我验证和自我修正(Maet al., 2025),SCRIT 使用自生成的训练数据提高批评能力(Tanget al., 2025b),SPOC 在单次推理过程中实现交互式的解决方案生成和验证(Zhaoet al., 2025)。在多模态推理中,Sherlock 通过引入针对视觉语言模型的轨迹级自我修正进一步扩展了这一方向(Ding and Zhang, 2025)。与此同时,最近的评估如 RealCritic 和 Self-Correction Bench 表明,对于许多当前模型,自我批评仍然不可靠,尤其是在自我批评和迭代修正设置中(Tanget al., 2025a; Tsui, 2025)。总的来说,这些方法内化了审议,但仍然依赖于显式的批评循环、多轮生成或专门的自我改进过程。这激发了更直接、更高效地在单一前向推理框架内支持审议的架构。 **参数高效混合专家。** 混合专家(MoE)为单一主干网络内的条件计算提供了一种自然机制,使其成为可扩展推理模型的一个有前景的基础(Lepikhinet al., 2021; Zhouet al., 2022)。近期的参数高效变体通过用稀疏激活的 LoRA 专家替代密集适配,将 MoE 与低秩适配相结合。早期的方法如 MoE-LoRA、AdaMV-MoE、MixLoRA 和 Uni-MoE 表明,在轻量级适配器之间进行路由可以在语言和多模态设置中改善容量-效率权衡(Liuet al., 2023b; Liet al., 2024a; Chenet al., 2023; Liet al., 2024b)。近期的工作通过改进优化、逐层专家分配、专家专业化和自适应专家选择进一步推进了这一方向(Sunet al., 2025; Gaoet al., 2025; Fenget al., 2025; Kunwaret al., 2025)。然而,大多数现有的 PE-MoE 方法仍然继承了两种对辩论式推理不太理想的假设。首先,每个专家通常被实例化为一个整体的适配器单元,将下投影和上投影耦合在单个路由决策下。这限制了辩证推理所需的不对称路由。其次,先前的 PE-MoE 方法主要采用令牌级路由(Liet al., 2024a; Zhanget al., 2025a)。虽然这对于通用序列建模有效,但这种细粒度路由可能导致相邻令牌间的专家分配不稳定,使其不太适合需要局部连贯性的辩证生成。 与上述文献相比,我们的辩论者混合(MoD)将辩论视为单个模型内部的路由问题,而非外部智能体之间的交互。MoD 结合了显式的视角转换监督和参数高效的 MoE 架构,将解释和综合专家池解耦以实现不对称的专家组成,并引入了双重路由和动量切换来稳定局部推理轨迹。这种设计在避免传统多智能体系统开销的同时,保留了辩论的行为多样性。 ## 3. 辩论者混合 我们提出**辩论者混合(Mixture-of-Debaters, MoD)**,一个在单个模型内实现动态自我辩论的统一框架。如图 2 所示,MoD 建立在冻结的视觉语言主干网络上,并引入了轻量级的 MoD 适配器来替代标准的 LoRA 模块。我们首先在第 3.1 节描述模型架构。接着在第 3.2 节介绍我们如何构建 MoD 指令调优数据集,该数据集为视角转换提供了显式的监督。最后,我们在第 3.3 节详细说明调优过程。 ### 3.1. 模型架构 MoD 支持纯文本和多模态输入,因此我们将输入记为 $(V, Q)$,在纯文本的情况下 $V = \varnothing$。我们专注于多模态设置,因为在这种设置下模态间的相互作用使得路由稳定
相似文章
潜在智能体:一种内化多智能体辩论的后训练方法
波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。
L-MAD:法律推理中多智能体辩论结构的系统性评估
本文介绍了L-MAD,一个用于系统性评估法律文本蕴含中多智能体辩论结构的框架。研究发现,增加智能体数量可提升准确率,但延长辩论轮次会导致有害的过度 deliberation 漂移,使得智能体互相强化错误,相较于单智能体基线最高提升8%。
自信的撒谎者:利用对数概率和LLM-as-Judge诊断多智能体辩论
本文研究了多智能体辩论系统中令牌级对数概率分布、LLM-as-judge评分标准分数和最终任务准确性之间的关系。它发现了一致的四阶段置信度轨迹以及Constructor与Auditor智能体之间的角色不对称性。
法律中多智能体协商研究
本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。
早期令牌置信度预测多智能体LLM辩论中的推理质量
本文研究了LLM解码过程中的早期令牌置信度信号是否能预测多智能体辩论系统中的推理质量,发现前几个生成令牌的置信度是基于评分标准的论文分数的最强预测因子。