超越共识:混合智能体中的轨迹级综合
摘要
本文揭示,聚合多个LLM智能体的完整推理轨迹(而非仅其最终答案)即使在所有智能体一致同意的情况下也能纠正错误,引入了“聚合悖论”以及Self-Consistent Mixture of Agents方法。
arXiv:2605.29116v1 Announce Type: new
摘要:当多个LLM智能体解决同一问题时,标准做法是将每个智能体的推理压缩为多数投票或分层综合,并将一致同意视为终点。我们表明这是不必要的损失:一个读取完整推理轨迹的LLM聚合器即使在所有智能体一致同意的情况下也能恢复正确解决方案,有益纠正持续超过有害纠正——\emph{聚合悖论}。多数投票存在一个扰动多样性无法提高的上限(误差相关性相同);聚合器的收益来自轨迹级互补性,从投票丢弃的少数链中组装正确的中间步骤。这些发现催生了Self-Consistent Mixture of Agents方法,该方法通过语义保留的输入扰动生成轨迹多样性,通过锚定精炼保护多数并具有可证明的非退化保证,并且始终进行综合——从不基于共识进行门控。一个具有扰动诱导轨迹变异的单一模型在结构化推理、博士级科学、竞赛数学和编程竞赛中优于异构模型池。聚合的单位应该是推理轨迹,而不是答案。
查看缓存全文
缓存时间: 2026/05/29 09:13
# 混合智能体中的轨迹级综合 来源:https://arxiv.org/html/2605.29116 ## 超越共识:混合智能体中的轨迹级综合 Shreyas Fadnavis Bioscope AI shreyas\.fadnavis@bioscope\.ai &Praitayini Kanakaraj Bioscope AI praitayini\.kanakaraj@bioscope\.ai &Felix Wyss Bioscope AI felix\.wyss@bioscope\.ai ###### 摘要 当多个 LLM 智能体解决同一问题时,标准做法是将每个智能体的推理压缩为多数投票或分层综合,将一致性视为终点。我们证明这会造成不必要的损失:能够读取完整推理轨迹的 LLM 聚合器即使在智能体一致同意的情况下也能恢复正确答案,且有益的修正始终超过有害的——即*聚合悖论*。多数投票存在一个上限,而扰动多样性无法提升该上限(误差相关性相同);聚合器的收益来自轨迹级互补性,即从投票所丢弃的少数链中组合正确的中间步骤。这些发现推动了自一致混合智能体的发展,该方法通过语义保持的输入扰动生成轨迹多样性,通过带可证非降级保证的锚定精炼来保护多数派,并且始终进行综合——从不以共识为门控。一个具有扰动诱导轨迹变异的单一模型在结构化推理、博士级科学、竞赛数学和竞争性编程方面均优于异构模型池。聚合的单位应该是推理轨迹,而不是答案。 ## 1 引言 大型语言模型中,推理时计算越来越依赖于生成多个候选解决方案并进行组合。自一致性(Wang 等人,2023 (https://arxiv.org/html/2605.29116#bib.bib15))对思维链答案进行投票,混合智能体(Wang 等人,2025a (https://arxiv.org/html/2605.29116#bib.bib39))跨模型层综合输出,多智能体辩论(Du 等人,2024 (https://arxiv.org/html/2605.29116#bib.bib31))让智能体在阅读彼此的推理后进行修改,而验证引导的选择(Khalifa 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib29); Dorner 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib30))则挑选最佳候选。尽管方法各异,但它们都通过投票、收敛或选择将一组推理轨迹简化为一个答案(参见附录 Y (https://arxiv.org/html/2605.29116#A25) 进行架构比较)。这种简化丢弃了推理产生的大部分信息。思维链轨迹记录了证明策略、中间计算、死胡同和隐含假设——然而在聚合时,每个轨迹被压缩为一个答案标记(投票中)或一个输出段落(分层综合中)。当智能体收敛时,标准启发式方法是接受共识并继续(Huang 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib24)),搁置那些可能包含多数派遗漏的正确中间步骤的少数链。我们发现这种信息丢失会产生可衡量的成本。当我们用读取完整推理轨迹的 LLM 聚合器取代多数投票时,即使在智能体一致同意错误答案的情况下,它也能恢复正确答案。在结构化推理、博士级科学、竞赛数学和竞争性编程的基准测试中,有益的修正始终超过有害的(§3 (https://arxiv.org/html/2605.29116#S3))。我们将此称为*聚合悖论*:对轨迹的综合精确地在投票表明无需改进的地方提高了准确性。图 1 (https://arxiv.org/html/2605.29116#S1.F1) 展示了一个 GPQA-Diamond 问题的完整流程,其中五次扰动产生了五种不同的证明策略,而轨迹级综合组合了单个轨迹中不存在的证据(附录 T.1 (https://arxiv.org/html/2605.29116#A20.SS1))。其机制超出了现有框架所能解释的范围。投票的上限并未因扰动多样性而提高——误差相关性在统计上相同(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px3))——并且具有输入扰动的单一模型可与异构模型池匹敌或超越(§5 (https://arxiv.org/html/2605.29116#S5.SS0.SSS0.Px7))。改进来自轨迹级互补性——不同链包含不同的正确中间步骤,而聚合器组装出任何单个链都未能产生的解决方案——且廉价的表面变异足以诱导这种互补性(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px4); Wu 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib25); Kruszewski 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib54))。这些发现推动了 SC-MoA(自一致混合智能体;§4 (https://arxiv.org/html/2605.29116#S4),图 2 (https://arxiv.org/html/2605.29116#S4.F2)):基于扰动的轨迹多样性,避免了模式崩塌;锚定精炼将辩论鞅(Choi 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib34))转换为具有可证非降级保证的下鞅;以及从不以共识为门控的综合。 #### 贡献。 - • *聚合悖论*:即使在一致同意的情况下,轨迹级综合也优于投票,有益翻转超过有害翻转(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px2);命题 1 (https://arxiv.org/html/2605.29116#Thmtheorem1),推论 2 (https://arxiv.org/html/2605.29116#Thmtheorem2))。 - • 扰动多样性并不会使误差去相关(对于多样化与 i.i.d. 提议,$\bar{\rho}$ 相同),然而综合通过轨迹级互补性超出了投票上限(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px3));廉价的表面扰动就足够了(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px4))。 - • SC-MoA(§4 (https://arxiv.org/html/2605.29116#S4),图 2 (https://arxiv.org/html/2605.29116#S4.F2)):扰动多样性、具有下鞅保证的锚定精炼(命题 3 (https://arxiv.org/html/2605.29116#Thmtheorem3))以及通用聚合。在我们的评估协议下(贪心解码,匹配计算),在所有五个基准测试中均获得最高准确率(表 1 (https://arxiv.org/html/2605.29116#S5.T1));单一模型优于异构模型池(§5 (https://arxiv.org/html/2605.29116#S5.SS0.SSS0.Px7))。 参照图注 图 1:SC-MoA 处理一个 GPQA-Diamond 化学问题。同一问题的五次语义扰动产生了结构不同的推理轨迹:两次通过不同的证明策略识别出正确答案 (A),而三次通过看似合理但不完整的论证得出错误答案。锚定精炼冻结多数答案并修改少数派,将共识从 2/5 提升至 5/5。轨迹级综合随后读取*所有*轨迹——包括现已修正的少数派——并将互补证据(例如,来自一个轨迹的对称苯炔论证和来自另一个轨迹的 D-保留同位素体计数)整合为一个连贯的解释。多数投票会返回相同的答案 (A) 但丢弃所有推理;综合通过将轨迹而非答案作为聚合单位,恢复了更丰富、更可靠的论证。 ## 2 相关工作 #### 自一致性与投票上限。自一致性(Wang 等人,2023 (https://arxiv.org/html/2605.29116#bib.bib15))对多条链进行采样并采取多数投票。后续工作改进了投票:排名(Wang 等人,2025b (https://arxiv.org/html/2605.29116#bib.bib20))、置信度加权(Taubenfeld 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib17))、不一致感知(Huang 等人,2024b (https://arxiv.org/html/2605.29116#bib.bib18))、自适应预算(Feng 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib19); Huang 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib24))、认证停止(Cordero-Encinar and Duncan,2025 (https://arxiv.org/html/2605.29116#bib.bib21))和改进的校准(Wang and Stengel-Eskin,2026 (https://arxiv.org/html/2605.29116#bib.bib46))。所有这些都改进了*如何*计票,但选票仍然是一个答案标记(Wu 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib25); Kruszewski 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib54))。Hamidi 等人(2026 (https://arxiv.org/html/2605.29116#bib.bib45))探讨了跨模型的多样性崩溃;我们建议阅读投票所丢弃的轨迹。 #### 多智能体辩论与分层协作。多智能体辩论(Du 等人,2024 (https://arxiv.org/html/2605.29116#bib.bib31); Smit 等人,2024 (https://arxiv.org/html/2605.29116#bib.bib33))和混合智能体(Wang 等人,2025a (https://arxiv.org/html/2605.29116#bib.bib39))允许智能体读取并响应完整输出,但无结构的交互可能失败:Choi 等人(2025 (https://arxiv.org/html/2605.29116#bib.bib34))证明了无约束辩论是一个鞅,Khan 等人(2024 (https://arxiv.org/html/2605.29116#bib.bib32))表明辩论仅在非对称知识下有帮助,而 Rizvi-Martel 等人(2026 (https://arxiv.org/html/2605.29116#bib.bib38))刻画了交流何时根本没有帮助。GoA(Yun 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib41))和 AgentAuditor(Yang 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib55))解决了特定的失败模式,但需要模型多样性或额外训练。SC-MoA 的锚定精炼(§4 (https://arxiv.org/html/2605.29116#S4.SS0.SSS0.Px2))限制了可更改的内容,而不是结构化交互(图 13 (https://arxiv.org/html/2605.29116#A25.F13))。 #### 验证、选择与综合上限。测试时计算扩展(Snell 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib22); Chen 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib23))通过采样和选择提高准确性;ThinkPRM(Khalifa 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib29))对验证链进行评分以进行最佳 N 选择,而 Dorner 等人(2026 (https://arxiv.org/html/2605.29116#bib.bib30))刻画了最佳 N 的上限。批评-修订方法(Madaan 等人,2023 (https://arxiv.org/html/2605.29116#bib.bib26); Shinn 等人,2023 (https://arxiv.org/html/2605.29116#bib.bib27); Yuksekgonul 等人,2025 (https://arxiv.org/html/2605.29116#bib.bib49))在单个解决方案上迭代,但缺乏收敛保证(Wang 等人,2024 (https://arxiv.org/html/2605.29116#bib.bib50); Huang 等人,2024a (https://arxiv.org/html/2605.29116#bib.bib28))。所有这些都有一个共同界限:准确性不能超过最佳候选。轨迹级综合通过跨链整合证据超越了这一点(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px2))。 #### 扰动多样性与轨迹。DiVeRSe(Li 等人,2023 (https://arxiv.org/html/2605.29116#bib.bib16))结合了多样化的提示与步骤感知验证;SPUQ(Gao 等人,2024 (https://arxiv.org/html/2605.29116#bib.bib42))引入了语义保持的扰动以进行不确定性量化;BayesPE(Tonalini 等人,2024 (https://arxiv.org/html/2605.29116#bib.bib44))在贝叶斯框架中形式化了提示集成;提升集成(Pitis 等人,2023 (https://arxiv.org/html/2605.29116#bib.bib8); Freund and Schapire,1997 (https://arxiv.org/html/2605.29116#bib.bib6))将重新加权适应于提示选择;Polyjuice(Wu 等人,2021 (https://arxiv.org/html/2605.29116#bib.bib47))和 Tailor(Ross 等人,2022 (https://arxiv.org/html/2605.29116#bib.bib48))组合了具有*改变意义*编辑的扰动基元。所有这些都使用扰动来改善多样性或估计不确定性,将轨迹简化为投票或置信区间。我们将扰动扩展到推理综合,并发现扰动*内容*在测试的家族中并非关键(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px4))。Kambhampati 等人(2025 (https://arxiv.org/html/2605.29116#bib.bib56))认为轨迹是计算脚手架,而 Valmeekam 等人(2025 (https://arxiv.org/html/2605.29116#bib.bib57))表明语义受损的轨迹保持了准确性,暗示轨迹内容作为计算脚手架发挥作用。我们的发现是互补的推理时观察(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px3)、3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px4)):轨迹级互补性是输出分布的一个统计属性,而非关于内部认知的主张。 ## 3 聚合悖论 我们现在检验以下主张:轨迹级互补性携带了标准聚合所丢弃的可利用信息。三个观察结果共同构成了*聚合悖论*:即使在共识情况下,综合也优于投票(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px2));投票上限具有约束力,但综合超过了它(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px3));并且扰动内容并非关键——廉价的表面变异就足够了(§3 (https://arxiv.org/html/2605.29116#S3.SS0.SSS0.Px4))。 #### 受控设置。为了将聚合机制与混淆因素(模型异质性、提示工程、温度采样)隔离开,我们在本节中固定一个单一的受控协议。$N=5$ 个智能体使用相同的模型(gpt-oss-120b)和贪心解码(温度 0)。语义保持的输入扰动(SPUQ;Gao 等人,2024 (https://arxiv.org/html/2605.29116#bib.bib42))从每个智能体生成结构不同的推理轨迹。我们将多数投票与应用于*相同*提议集的 LLM 综合进行比较,因此唯一的变量是聚合机制。评估涵盖五个基准测试(BBH-3、MMLU-ML、GPQA-Diamond、AIME、LCB-Hard;详情见 §5 (https://arxiv.org/html/2605.29116#S5.SS0.SSS0.Px1))。 #### 即使在共识情况下,综合也优于投票。标准实践将聚合门控于共识:如果智能体同意,则接受多数答案并节省计算(Huang 等人,2026 (https://arxiv.org/html/2605.29116#bib.bib24))。这个逻辑听起来合理——当答案已确定时,为何还要进行昂贵的综合调用?但这个逻辑是错误的。在 GPQA-Diamond($n=198$)上进行的受控预精炼设置中,轨迹级综合产生了 12 次有益翻转对比 5 次有害翻转(2.4 倍;+3.5 个百分点;McNemar $p=0.09$;表 29 (https://arxiv.org/html/2605.29116#A20.T29),附录 T (https://arxiv.org/html/2605.29116#A20))。在 BBH-3($n=296$)上,相同的预精炼分析产生了 16 次有益对比 5 次有害(3.2 倍;+3.7 个百分点;$p=0.016$;附录 T (https://arxiv.org/html/2605.29116#A20))。在锚定精炼之后,有害翻转被消除:在完整流程的所有四个问答基准测试中(表 31 (https://arxiv.org/html/2605.29116#A20.T31)),BBH 和 AIME 显示出零次有害翻转——精炼将五次预精炼中的有害翻转转换为正确答案,这本身就是一个重要发现。以下分解形式化了这种不对称性。 ###### 命题 1(综合优势分解)。令 Vote 和 Synth 是对同一 $N$ 个提议应用的两种聚合过程。定义*合成保真度* $F_s = \mathbb{P}(\textsc{Synth} \text{ 正确} \mid \textsc{Vote} \text{ 正确})$ 和*恢复率* $R_s = \mathbb{P}(\textsc{Synth} \text{ 正确} \mid \textsc{Vote} \text{ 错误})$。然后: $$\underbrace{\mathbb{P}(\textsc{Synth} \text{ 正确}) - \mathbb{P}(\textsc{Vote} \text{ 正确})}_{\text{综合优势}} = \underbrace{\mathbb{P}_w \cdot R_s}_{\text{有益翻转}} - \underbrace{\mathbb{P}_c \cdot (1 - F_s)}_{\text{有害翻转}}$$相似文章
共识在战略层面的不足:将推理轨迹分歧作为知识表示信号
本文认为,在多智能体 LLM 系统中,追求共识对于涉及价值判断的任务而言是不够的,并提出一种知识表示层,将智能体推理轨迹的分歧归类为四种符号状态,以实现内容审核等系统中的策略性路由。
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
LLM代理的一致性如何?在多步骤工具调用流程中测量行为可重现性
本文系统性地测量了LLM代理在多步骤工具调用流程中的行为可重现性,涉及1140条轨迹,发现了'结构一致性,参数变异性'的模式:代理可靠地按相同顺序选择工具,但参数有所不同,并且结构一致性能够预测任务的成功。
自信的撒谎者:利用对数概率和LLM-as-Judge诊断多智能体辩论
本文研究了多智能体辩论系统中令牌级对数概率分布、LLM-as-judge评分标准分数和最终任务准确性之间的关系。它发现了一致的四阶段置信度轨迹以及Constructor与Auditor智能体之间的角色不对称性。
TeamTR:多智能体LLM协调的信任域微调
本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。