推理评审团:多模型共识评估推理轨迹
摘要
本文介绍了推理评审团(Reasoning Jury),这是一个利用开源权重LLM评审团和受调控的共识机制来评估长推理轨迹的系统,在识别推理缺陷方面显著优于前沿模型,而成本仅为其一小部分。
查看缓存全文
缓存时间: 2026/08/14 09:26
# Reasoning Jury:多模型共识用于评估推理轨迹
来源:https://arxiv.org/html/2608.12585
Congchao Wang, Diwakar Singh, Qiaozi Gao, Spyros Matsoukas, Yang Liu,\[4pt\] Mahdi Namazifar\[9pt\]Amazon AGI
###### 摘要
改进推理大语言模型(LLM)需要具备判断长推理轨迹质量的能力,以便进行有效的推理数据整理、在强化学习期间提供强有力的训练信号,以及在模型性能评估时深入理解推理行为。此外,揭示模型所犯的推理错误,可以通过提供反馈来提升模型在运行时的性能。由于这项任务在长推理轨迹上具有难度和复杂性,单一模型评判者(即使是前沿模型)在识别推理缺陷方面表现不佳。另外,在推理LLM的在线训练中,使用前沿模型通常会因使用条款中的限制而被禁止。在这项工作中,我们引入了*Reasoning Jury*(推理陪审团),这是一个用LLM陪审团和经过调解的共识机制取代单一评判者的系统,旨在提高识别推理缺陷的判断保真度。调解者通过陪审员之间的审议或对判断的整合来得出共识。我们证明,使用开放权重模型组成的陪审团在正确识别推理缺陷方面能够显著优于前沿模型(Opus、Sonnet和Gemini)。除了准确率性能的提升外,陪审团的总成本(初始裁决、审议、整合等)仅占以前沿模型进行LLM即评判者(LLM-as-a-judge)设置的运行成本的8%到16%。我们还展示了如何利用这些判断来理解推理LLM在基准测试中的失败模式,从而更深入地了解模型的性能。
## 1 引言
对推理轨迹的可靠评估支撑着推理LLM开发的多个阶段。监督微调依赖于高质量的推理轨迹并过滤低质量数据;强化学习依赖于能够区分好推理与坏推理的奖励信号;而推理LLM的性能评估和错误分析则依赖于对推理输出的诊断。所有这些都依赖于判断一条推理轨迹实际有多好的能力。与评估涉及短小且自包含答案的非推理模型不同,在推理LLM中,被评判的内容已转变为长链思维轨迹,其中包含数十到数百个相互依赖的步骤,一个糟糕的步骤可能会传播到后续所有内容,而且发现缺陷本身就极具挑战性。在这种设置下,评估不再仅仅是“最终答案是否正确”,而是“哪个推理步骤出了错,以及错误有多严重”。这种细粒度评估可以提供可操作的信号,用于改进推理质量的其他维度,包括token效率、自我检查行为和置信度校准。
图1:在Hard2Verify基准测试上,使用前沿模型(opus-4.6、sonnet-4.6、gemini-3.1-pro)陪审团与开放权重陪审团(3个gpt-oss-120b实例)进行推理缺陷检测的平衡F1分数对比。点代表单个陪审员,星号代表陪审团结果(绿色为审议模式,橙色为整合模式)。前沿模型在单独表现上优于gpt-oss-120b。然而,由gpt-oss-120b组成的Reasoning Jury在推理缺陷检测上优于这些前沿模型,最高可达12个百分点。该Reasoning Jury在审议模式下的美元成本为opus-4.6在该任务上成本的15.6%,在整合模式下为8%(参见表2 (https://arxiv.org/html/2608.12585#S4.T2))。
识别有缺陷的推理轨迹,尤其是那些严重程度更高的缺陷,能够为中期训练和SFT阶段实现有效的训练数据过滤。此外,准确定位这些缺陷发生的位置,使得可以利用专家人工标注者或使用LLM来重写推理轨迹中的缺陷部分。而且,这种高保真的缺陷检测可以在强化学习期间用于引导模型的推理行为。诸如NuRL\[5 (https://arxiv.org/html/2608.12585#bib.bib13)\](在生成过程中使用离线生成的提示)、scaf-GRPO\[30 (https://arxiv.org/html/2608.12585#bib.bib14)\](检测到训练停滞时在提示中使用提示)、SDPO\[16 (https://arxiv.org/html/2608.12585#bib.bib15)\](使用自然语言反馈作为提示)等方法,都是依赖超越结果分数的丰富信号的强化学习方法。这些信号可以包括基于缺陷的二元分数、避免缺陷的自然语言提示,或缺陷发生的特定token;强化学习可以从高保真且丰富的推理缺陷检测中受益匪浅。除了模型训练之外,新的推理时扩展方法(如\[1 (https://arxiv.org/html/2608.12585#bib.bib16)\])利用模型输出的评估结果作为迭代循环中的输入反馈给模型,以提高模型在运行时的性能。按照这种方法,识别出的推理缺陷可以被反馈给模型,以纠正其推理错误并提高其性能。同样,在模型评估中,除了报告基准测试的准确率分数外,还可以报告推理缺陷、其分布以及主要失败模式,这些将指导训练过程和模型改进。
此类判断的主流解决方案是使用单一强模型作为LLM即评判者\[32 (https://arxiv.org/html/2608.12585#bib.bib2),14 (https://arxiv.org/html/2608.12585#bib.bib3)\]。这在短输出上是足够的,但恰恰在长推理场景中失效,原因是推理轨迹的上下文很长且推理缺陷检测任务复杂(结果见4.1节 (https://arxiv.org/html/2608.12585#S4.SS1))。对于这类具有挑战性的任务,单一模型在评判推理轨迹时只带来一种视角,它遗漏或误判的内容仍然是错误的。这里一个自然的补救措施反映了人类机构处理高风险判断的方式,即召集一个*陪审团*,由来自不同模型家族的多个独立评判者组成,他们的盲区是去相关的,因此一个人的误判往往会被另一个人发现。这是一个不断发展的研究方向,其中多样化的LLM小组(以及它们之间的辩论)相对于任何单一评判者都能提高评估质量\[28 (https://arxiv.org/html/2608.12585#bib.bib1),10 (https://arxiv.org/html/2608.12585#bib.bib4),4 (https://arxiv.org/html/2608.12585#bib.bib8)\]。我们在这一研究方向的基础上,专门解决在长推理轨迹中检测逐步定位缺陷的问题。为此,我们引入了*Reasoning Jury*。该方法的主要假设是,输入给Reasoning Jury的每条推理轨迹都被划分为由\[STEP-x\]标记的推理“步骤”,其中x是步骤计数器。反过来,Reasoning Jury标记的每个裁决都对应到轨迹中特定的\[STEP-x\]标记,这使得每个判断都可审计(人类可以检查)且可操作(它指向缺陷发生的具体步骤)。
为了识别推理缺陷,Reasoning Jury在陪审团上运行一个两阶段过程:第1阶段从陪审员处获得独立判断,第2阶段基于这些裁决达成共识。在第1阶段,每个陪审员阅读问题和分段后的推理轨迹,并*独立地*输出一份结构化的缺陷列表。每个缺陷都附带:1)对缺陷的自包含描述;2)缺陷所在的\[STEP-x\]列表;3)缺陷的严重程度;4)推理轨迹中缺陷的详细证据。图2 (https://arxiv.org/html/2608.12585#S1.F2) 展示了一个典型的缺陷示例,针对的是解决数学奥林匹克竞赛问题的推理轨迹。这样,陪审员在任何一个人可能受到其他人影响之前,便提交了去相关的观点。在第2阶段,根据这些裁决推导出共识。该阶段有两种模式,即整合(Consolidation)和审议(Deliberation)。在整合模式下,原始内容以及第1阶段的裁决被传递给一个评判者,并要求该评判者对它们进行整合。在审议模式下,调解者主持一场多轮辩论,陪审员们就这些缺陷进行辩论,直到达成共识或辩论陷入停滞。调解者决定每轮由哪位陪审员发言、该陪审员应针对什么内容,以及讨论何时已足够收敛以终止。然后调解者根据完整的审议记录综合出陪审团的共识。值得注意的是,调解者不会获得原始问题、推理轨迹或候选解决方案。但它能看到内容丰富的陪审员论点,维护声明级别的共识状态,选择发言人,并决定终止条件。因此,这种设计将直接访问源材料与控制讨论分离开来。我们将不提供轨迹视为一种设计启发式方法,旨在限制直接重新裁决,而不是作为无偏调解的结构性保证。我们的实验并未单独验证其因果效应。
根据设计,第1阶段和第2阶段对单个缺陷发现保留兼容的核心输出模式,而第2阶段在适用时添加共识和审议元数据。
致命缺陷
问题:设整数\(k\geq 2\)。确定所有正整数序列\(a_{1},a_{2},\ldots\),使得存在一个次数为\(k\)、具有非负整数系数的首一多项式\(P\),满足\(P(a_{n})=a_{n+1}a_{n+2}\cdots a_{n+k}\)对所有整数\(n\geq 1\)都成立。
错误之处:在\[STEP-3\]中,轨迹声称对于特征多项式\(r^{k}+r^{k-1}+\cdots+r-k=0\),“除\(r=1\)外的所有根的绝对值必须严格小于1。”这是错误的:对于\(k=2\),多项式可以分解为\((r-1)(r+2)\),得到一个根\(r=-2\),且\(|r|=2>1\)。轨迹中的三角不等式论证只能排除单位圆上除1之外的根;它从未排除\(|r|>1\)。这个错误论断正是推导得出结论\(d_{n}=a_{n+1}-a_{n}\)最终为常数所需的,因此案例的其余部分建立在一个错误的基础上。
声明引用:\["STEP-3"\]
影响:致命
证据:“所以除\(r=1\)外的所有根的绝对值必须严格小于1。递推式的通解为\(d_{n}=A\cdot 1^{n}+\sum_{i}P_{i}(n)r_{i}^{n}\),其中\(|r_{i}|<1\)。当\(n\to\infty\)时,\(d_{n}\to A\)。”
图2:第1阶段中陪审员在Hard2Verify的一道奥林匹克竞赛题上产生的一个典型缺陷。陪审员将其判断关联到特定的\[STEP-x\],对错误给出自包含的解释,标注严重程度,并引用轨迹作为证据。
为了评估Reasoning Jury,我们使用推理缺陷基准测试Hard2Verify\[25 (https://arxiv.org/html/2608.12585#bib.bib6)\]和DeltaBench\[15 (https://arxiv.org/html/2608.12585#bib.bib18)\]。在这些基准测试上,我们展示了由开放权重模型组成的陪审团可以轻松超越前沿模型。此外,尽管陪审团的整合或审议比单一模型评判者消耗更多的token,我们证明Reasoning Jury的成本相比使用前沿LLM作为评判者的成本只是一小部分。由于将封闭权重前沿模型用于LLM训练存在法律和实际限制,具有高保真度的开放权重模型陪审团将为在LLM训练中使用此类陪审团提供灵活路径。我们的基准测试评估衡量的是陪审团是否定位到缺陷步骤,但并未直接验证`what_went_wrong`的事实准确性、严重性标签的校准,或这些字段在一般下游用途中的有用性。对这些属性跨模型和任务进行全面评估仍是未来工作。不过,我们确实提供了一个初步的基于任务的测试,以检验更丰富的缺陷描述是否能帮助模型修复其推理。对于AIME2026的每个问题,我们使用nemotron-3-super生成了64个解决方案(共1,920条轨迹),用陪审团评估每条轨迹,并让同一模型重试被标记为至少一个非中性缺陷的877条轨迹。提供`what_went_wrong`诊断和严重性信息后,重试准确率从仅提供步骤位置时的71.2%提升至76.2%。第6节 (https://arxiv.org/html/2608.12585#S6) 总结了该实验,附录N (https://arxiv.org/html/2608.12585#A14) 提供了完整的设计和结果。
## 2 Reasoning Jury
### 2.1 将轨迹划分为步骤
对推理轨迹中检测到的缺陷进行定位,需要某种方式来引用缺陷在长推理轨迹中的确切位置。将长推理轨迹分割为*推理步骤*可以实现这种定位,陪审员在声称存在缺陷时可以引用例如\[STEP-14\]。为了实现这种推理步骤分割,文献中的绝大多数工作会在每个双换行(模式`\n\n`)处插入步骤边界\[17 (https://arxiv.org/html/2608.12585#bib.bib5),31 (https://arxiv.org/html/2608.12585#bib.bib9),33 (https://arxiv.org/html/2608.12585#bib.bib10),6 (https://arxiv.org/html/2608.12585#bib.bib11),27 (https://arxiv.org/html/2608.12585#bib.bib12)\]。虽然简单,但这种方法有其缺点,包括可能将步骤边界放在代码或伪代码片段中间、多行代数推导中间,或简单案例枚举中间。此外,如果模型只使用单个换行而不是双换行,或者总体上较少使用换行,这种方法就会变得不够稳健。另一种方法可能是使用强LLM作为一次性分割器,即提示LLM为长推理轨迹添加步骤标记并生成语义连贯的步骤。但正是本文所关注的同一问题——长内容自身的不稳定性——在这里同样适用:分割在多次重新采样之间不稳定,最重要的是,大型LLM可能无法完全忠实于主要推理文本,而是对其做出修改,从而导致分割后的推理轨迹与原推理轨迹不同。理想情况下,一个专门的、专用的推理步骤分割模型可以满足这一需求;但在缺乏这种模型的情况下,我们使用句子结束字符后跟`\n\n`的模式(正则表达式`(?<=[\.\!\?])\s*\n\s*\n+`)将推理轨迹分割为推理步骤。添加句子结束字符可以提高该模式对于包含代码和多步代数推导的轨迹的稳健性。
### 2.2 Reasoning Jury流水线
#### 2.2.1 第1阶段:独立判断
所有陪审员收到相同的提示,包括原始问题、带步骤标注的轨迹和最终解决方案。每个陪审员独立返回一个JSON对象,其中包含多个裁决,每个裁决带有`what_went_wrong`(对缺陷的自包含描述)、`statement_refs`(缺陷所引用的步骤列表)、`impact`(缺陷严重程度:\(\mathtt{neutral}\!\mid\!\mathtt{minor}\!\mid\!\mathtt{major}\!\mid\!\mathtt{fatal}\))以及`evidence`(识别出的缺陷的支持证据)。完整提示可参见附录B (https://arxiv.org/html/2608.12585#A2)。它强制进行*通用性测试*(“这条评论能否不经修改就适用于其他问题?如果可以,请重写”)和*特异性自检*(1-5分;只包含得分≥4的问题),以抑制模糊的、缺乏依据的批评。`what_went_wrong`试图捕获弱点相似文章
推理共识:基于加权DAG聚合的LLM推理结构集成
本文提出一个框架,通过加权合并从多个大语言模型中提取的有向无环图(DAGs)来集成其推理结构,从而在多个基准测试中实现更准确、更具可解释性的共识推理。
ReasoningFlow: 用于理解LLM推理轨迹的篇章结构
介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。
JuryProbe:一种用于将无参考事实性判断面板路由到基于验证的经验共识风险诊断
JuryProbe提出了一种经验性诊断工具,用于评估无参考LLM判断面板在事实核查中的共识风险,并采用基于校准的路由策略,利用可信参考对高风险决策进行验证,从而降低误接受率。
让LLMs相互评判:用于医学问答的多智能体同行评审推理
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines
This paper shows that LLM judges embedded in reasoning pipelines often make poor decisions, and proposes Evidence-Locked Derive–Gate–Repair (EL-DGR) to constrain judge overrides with evidence certificates, improving accuracy over majority vote and first-candidate baselines.