推理共识:基于加权DAG聚合的LLM推理结构集成
摘要
本文提出一个框架,通过加权合并从多个大语言模型中提取的有向无环图(DAGs)来集成其推理结构,从而在多个基准测试中实现更准确、更具可解释性的共识推理。
arXiv:2607.27783v1 公告类型:新
摘要:大型语言模型(LLMs)通过思维链探索问题,但这种探索被埋藏在非结构化的文本中。在高风险任务中,用户无法判断哪些步骤有充分依据,哪些替代方案被认真考虑过,或者最终结论与模型放弃的那些方案相比如何。我们提出了一个框架,通过对从推理链中提取的有向无环图(DAGs)进行加权合并,集成多个LLM的推理结构而不仅仅是答案。我们根据每条推理步骤被多少条轨迹独立验证来加权,以返回“共识推理”。在涵盖法条解释、研究生级科学、叙事多跳推理和一阶逻辑的六个基准测试中,我们的集成方法在相同预算下优于多数投票基线,在MuSR-MM(叙事多跳推理)上最高提升3.1%的准确率。在单一模型上,该框架在相同轨迹预算下达到或超过自我一致性,同时额外暴露了一个可检查的共识推理图。集成权重与LLM法官对推理质量的排名相关,Spearman ρ = 0.30-0.51,并且在六个数据集中的五个上,共识子图在54.4-65.4%的正面比较中优于导致多数投票答案的替代方案。我们观察到,该框架还可以用于分析问题的不同推理视角。
查看缓存全文
缓存时间: 2026/07/31 10:02
# 推理共识:通过加权有向无环图聚合实现LLM推理的结构化集成
**来源:** https://arxiv.org/html/2607.27783
Amruta Parulekar, Jinu Lee, Dilek Hakkani-Tür, Hari Sundaram
伊利诺伊大学厄巴纳-香槟分校
\{amp20, jinulee2, dilek, hs1\}@illinois.edu
###### 摘要
大型语言模型(LLMs)通过思维链(chain-of-thought)探索问题,但这种探索被掩埋在非结构化的散文中。在高风险任务中,用户无法判断哪些步骤有充分依据、哪些备选方案被认真考虑过,也无法判断最终结论与被模型放弃的结论相比孰优孰劣。我们提出一个框架,通过加权合并从多个LLM的推理链中提取的有向无环图(DAG),来集成多个LLM的**推理结构**而不仅是答案。我们根据每个步骤被多少条独立推理轨迹所证实来赋予权重,从而返回“共识推理”(Consensus Reasoning)。在涵盖法条解释、研究生级科学、叙事多跳推理和一阶逻辑的六个基准测试中,我们的集成方法在每一个数据集上都优于匹配预算的多数投票基线,在MuSR-MM(叙事多跳推理)上最大准确率提升达3.1%。在单一模型上,该框架在相同推理轨迹预算下匹配或超越自我一致性(self-consistency),同时还额外提供了可检查的共识推理图。集成权重与LLM裁判对推理质量的排名之间的Spearman相关系数为ρ=0.30–0.51。在六个数据集中的五个上,共识子图在54.4–65.4%的头对头比较中优于通向多数投票答案的备选方案。我们观察到,该框架还可用于分析一个问题多种不同的推理视角。¹¹¹我们的代码可从此链接获取:https://anonymous.4open.science/r/REASONING-CONSENSUS-5058
# 推理共识:通过加权DAG聚合实现LLM推理的结构化集成
Amruta Parulekar, Jinu Lee, Dilek Hakkani-Tür, Hari Sundaram
伊利诺伊大学厄巴纳-香槟分校
\{amp20, jinulee2, dilek, hs1\}@illinois.edu
## 1 引言
我们提出一个框架,对多个LLM的**推理结构**进行集成,以呈现复杂推理任务中多样且可解释的论证。复杂的领域特定推理允许多条合理的推理路径,而彻底的分析必须考虑每一条路径(Yang et al., 2026)。这些路径在LLM返回的非结构化思维链(Wei et al., 2023)中丢失了。用户看到的是一个最终答案和一段自由形式的理由说明,却无法判断哪些步骤和结论得到了支持或被否决,也无法判断哪些论证依赖于单一的不确定推理。较小的模型还会因固守单一解题路径而加剧这一问题,错过了可能更好的备选论证(Yang et al., 2025b)。其结果就是脆弱的推理(Zeng et al., 2026),在低资源、高风险的场景中尤其代价高昂(Dahl et al., 2024),因为模型可能给出正确答案但附带错误的支持理由,从而误导用户。
现有的改进思维链(CoT)的策略要么限制推理多样性,要么丢弃使推理可审计的结构。自我一致性(Self-consistency,Wang et al., 2023)仅对最终答案进行多数投票,没有考虑推理轨迹的结构。思维树/思维图(Tree/Graph of Thoughts,Yao et al., 2023; Besta et al., 2024)展示了更多的推理结构,但仍然受限于单一模型的天花板。多模型方法以牺牲结构可审计性为代价拓宽了探索范围:有些方法跨模型扩展了探索,但仍固守单条链(Xu et al., 2025);另一些方法在非结构化散文层面进行聚合,使得难以追踪哪个模型贡献了什么(Wang et al., 2024; Chen et al., 2024);而基于搜索的集成需要训练过程奖励模型,最终返回的也只是单条最佳链(Park et al., 2024)。因此,分歧的结构和备选支持信息就丢失了。
我们的框架将自我一致性(Wang et al., 2023)从答案层面推广到推理结构层面,从单一模型推广到多个模型。我们从多个模型中采样CoT推理轨迹,并对它们底层的推理图进行集成。我们从每条推理轨迹中提取一个有向无环图(DAG),并在合并这些DAG时保留联合支持前提的束(bundles),从而使每个合并后的节点都带有一个“证言计数”(attestation count)。出现于多条推理轨迹中的步骤会累积权重,而仅由一条轨迹证实的步骤会被自动降权,从而抑制推理步骤错误。我们返回最受支持、可检查的“共识”子图和结论,同时量化每个结论获得的支持量,以及其他可能的答案及其各自的支持量。
我们在六个推理基准上评估了我们的框架,涵盖法条解释(SARA)、研究生级科学(GPQA Diamond)、叙事多跳推理(MuSR-MM、MuSR-OP、MuSR-TA)和一阶逻辑蕴含(FOLIO)。我们的准确率加权4模型集成在每一个数据集上都优于匹配预算的20条推理轨迹多数投票基线,在MuSR-MM上最大增益为3.1%。在单一模型上,我们匹配或超越自我一致性,同时额外提供可检查的论证图。除准确率外,共识子图包含比单一模型推理轨迹更好的解释:在六个数据集中的五个上,共识子图在54.4–65.4%的LLM裁判头对头比较中优于通向多数投票答案的备选方案。我们的子图排名与裁判的Spearman相关系数为ρ=0.30–0.51。在定性方面,我们观察到子图可能包含不同的解题方法,证实推理视角的多样性可以通过结构化聚合得到保留。
我们的贡献:(1)**异构LLM推理的结构化集成**。我们引入了一个在DAG层面而非非结构化散文层面聚合推理的框架。这使得高风险领域的用户能够检查并覆盖单个步骤,而不是将LLM视为黑盒。(2)**无需辅助训练的证言加权置信度**。我们完全从不同模型之间的跨轨迹一致性中推导出步骤级置信度。这为过程奖励模型提供了一种免训练的替代方案,可推广到没有步骤级标签的低资源领域。(3)**准确率提升与多样、可检查的备选方案**。我们的框架在所有六个基准上都优于多数投票基线,在单模型推理轨迹池上匹配或超越自我一致性,同时呈现最受支持的子图并保留其他推理轨迹探索过的竞争性结论。通过保留而非压缩分歧结构,我们的框架自然地扩展到开放式场景,如论证生成和创意写作,其目标不是单一正确答案,而是一组经过精选的、各有充分依据的不同视角。
## 2 相关工作
近期诸如o1(OpenAI et al., 2024)和DeepSeek-R1(Guo et al., 2025)等“重推理”模型推广了长格式思维链(CoT)推理轨迹(Wei et al., 2023)。然而,线性CoT压缩了那些更适合用图建模的逻辑依赖关系。为了丰富**单个**模型推理的拓扑结构,思维树(Tree-of-Thoughts,Yao et al., 2023)将链分支化以实现回溯;思维图(Graph-of-Thoughts,Besta et al., 2024)进一步将其推广为带聚合和反馈的思维图。虽然这些方法展示了更多的推理结构,但它们的多样性仍然受限于单个孤立模型所能产出的范围。
后续方法以牺牲结构可审计性为代价扩大了探索范围。轨迹级聚合方法,如自我一致性(Self-Consistency,Wang et al., 2023),从一个模型采样多条CoT并对最终答案进行投票。协作束搜索(Collaborative Beam Search,Xu et al., 2025)通过多模型共识在每一步选择最佳延续来扩展这一思路。在响应层面,Mixture-of-Agents(Wang et al., 2024)和ReConcile(Chen et al., 2024)根据不同智能体的批评生成单一响应。最后,诸如LE-MCTS(Park et al., 2024)和MoSA(Yang et al., 2025b)等结构化搜索方法在多个LLM步骤上使用蒙特卡洛树搜索,而DER(Hu et al., 2025)训练一个路由器来选择最佳专家输出。这些方法产生了多样性,但最终在聚合时又将其压缩掉。通过投票、散文合成和奖励引导搜索,这些系统迫使结果收敛为单一条链或答案,备选路径被丢弃。
一条并行的研究路线通过保留而非丢弃分歧结构来避免这种压缩。ARGORA(Jin et al., 2026)将多专家讨论组织成论证图(argumentation graphs),以识别竞争性主张之间的因果依赖关系,但它依赖受限的交互式辩论和因果干预来评估论证的脆弱性。我们的框架则是从跨模型的独立、无约束CoT推理轨迹中提取并集成DAG,通过统计共识而非反事实干预来保留带权重的完整推理步骤证言图。我们从不强制收敛:当模型产生分歧时,两种结论连同其支持子图都会被保留。共识从独立推理者中自然涌现。最终结构在节点层面保持可审计性。
## 3 方法
我们的流水线(图1)分为五个阶段——推理轨迹提取(3.1节)、DAG提取(3.2节)、节点合并(3.3节)、集成加权(3.4节)和共识发现(3.5节)——将多条自由形式的推理链转换为带权重的、可审计的图,并获得共识推理。一个查询被提供给多个LLM,它们采样大量推理轨迹;从每条轨迹中提取一个有向无环图(DAG),将这些DAG集成为一个加权图,然后提取支持度最高的结论及其最受支持的推理轨迹。所有提示词见附录A。
### 3.1 推理轨迹提取
我们从几个小型开源LLM中的每一个模型中,对每个查询采样多条随机推理轨迹。每个模型被约束为固定模式,要求生成逐步推理轨迹和最终裁决标签。对于每次生成,我们将自由形式的推理与裁决分开,并同时保留二者以用于后续的DAG提取和集成。
### 3.2 DAG提取
参见图注
**图1:** 详细流水线。**第1步:** 多个LLM为一个查询采样推理轨迹。**第2步:** 每条轨迹被分解为一个DAG,节点标签为规划(Planning, P)、事实(Fact, F)、推理(Reasoning, Re)和结论(Conclusion, C)。带类型的节点标签使得独立生成的DAG可以逐步对齐和合并,而不是作为不透明的散文进行比较。**第3步:** 基于语义相似性合并节点。我们的混合集成策略首先按类型(以颜色显示)和嵌入相似性(阈值τ′)过滤候选节点对,然后用LLM裁判验证存活的节点对。验证通过的节点对合并为一个节点,代表由多条轨迹共同证实的同一推理步骤。这种混合方法既避免了仅基于相似性合并的误报,也避免了仅依赖LLM合并带来的O(n²)成本。**第4步:** 集成节点根据跨轨迹证言进行加权,可采用简单加权(每条轨迹投一票,因此权重取决于原始证言计数)或准确率加权(每票按其来源模型在保留集上的准确率缩放)。红色边表示败者(defeaters),灰色边表示支持者(supporters)。边上的数字是证言计数。准确率加权(为清晰起见用整数,实际中为小数)将质量向由更强模型证实的步骤倾斜。**第5步:** 提取支持度最高的答案及其支持度最高的论证。输出保留了单一LLM思维链所缺乏的备选推理路径和步骤级支持度。
每条推理轨迹都通过一个小型LLM作为结构化提取器转换为细粒度的因果DAG。为使任务可行,LLM生成节点时附带**预分组束**——每个束是一个节点id列表,这些节点必须作为一个整体来支持某个目标——因此逻辑结构通过束中的前提分组来编码。每个节点携带一个id、一个节点类型、一段简短的文本描述以及束列表:一个**支持**列表,其中的每个束独立地论证该节点;以及一个**击败**列表,其中的每个束独立地抑制该节点。束内的前提是合取(conjunctive)关系;列表内的束之间是析取(disjunctive)关系。
**逻辑重建。** 一个AND/OR图G=(V, S)通过一次确定性遍历重建:每个支持束成为一个正支持集,每个击败束成为一个否定集,每个节点的门(gate)根据其正支持集的数量分配——若没有则为原子(Atomic),若有一个则为And,若有多个则为Or。形式上,S(v)={(S₁,δ₁),(S₂,δ₂),...},其中每一对(S_k,δ_k)由一个前驱集合S_k⊆V(共同支持v)和一个极性标志δ_k∈{0,1}组成,表示支持(δ_k=0)或可击败(δ_k=1)。我们验证所有节点类型合法、束成员引用有效节点、并且图是无环的。未通过任何检查的轨迹将被丢弃,以免格式错误的输出污染聚合。
**DAG结构。** 受Lee等人(2025)启发,我们使用四种标签:*规划*(其中LLM决定下一步做什么)、*事实*(来自输入上下文的事实陈述)、*推理*(将事实与结果联系起来的中间推理步骤)、以及*结论*(最终判定)。这种结构强调程序性推理,非常适合包含关于解题过程的元推理的轨迹。在结论之后添加一个最终的*答案*节点,与预测标签完全匹配。这些DAG构成节点合并的输入。
### 3.3 节点合并
我们的节点合并策略先按嵌入相似性过滤同类型候选节点对,再进行LLM验证,从而在计算开销与合并精度之间取得平衡。两者都不可省略:仅基于相似性的合并会产生误报(语义相似但逻辑角色不同的步骤被合并),而仅靠LLM验证O(n²)的所有节点对则成本过高。相似文章
推理评审团:多模型共识评估推理轨迹
本文介绍了推理评审团(Reasoning Jury),这是一个利用开源权重LLM评审团和受调控的共识机制来评估长推理轨迹的系统,在识别推理缺陷方面显著优于前沿模型,而成本仅为其一小部分。
基于外部子图生成的大语言模型逐步推理增强
本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。
通过结构不确定性量化LLM逻辑推理的一致性
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。
LC-ERD:通过一致性规约的奖励分解挖掘潜在逻辑实现自我进化推理
LC-ERD是一个框架,从LLM生成的推理链中挖掘潜在逻辑,将全局奖励分解为步骤级信号,实现无需人工标注的自我进化推理。它通过变分逻辑势和多智能体值分解来解决标签噪声、粗粒度监督和分布崩溃问题。
我们能否信任LLM的逻辑?通过基于图的框架量化不确定性、一致性和稳健性
本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。