精确但不耦合:审稿人的精确性并不能保证在多智能体数学推理中采纳批评意见

arXiv cs.AI 论文

摘要

本文研究多智能体数学推理系统,发现审稿人在识别错误方面的精确性并不能保证解题者会采纳这些批评意见,揭示了检测与有效采纳之间的差距,从而限制了整体性能的提升。

arXiv:2607.15388v1 Announce Type: new Abstract: 许多面向数学和科学的智能体系统采用分层设计,配备专门的审稿角色,假设专门的审稿阶段应有助于将错误的候选答案转化为正确的答案。我们在4,181个基于验证器的Omni-MATH问题上使用匹配的gpt-oss-120b智能体测试了这一假设。在最简单的层级上,协作几乎不带来收益,但从第4层开始,收益急剧增加;在这种更难的场景中,广播式的同伴讨论比规划-执行-审稿流水线(PER)达到了更高的最终准确率。我们探究这一差距是由审稿质量解释,还是由批评意见是否改变协议推进的下一个答案来解释。它不能单独由审稿精确性解释:PER的审稿人比广播式的更精确(0.861 vs. 0.644),但经过评估者验证的有用批评意见改变下一个候选答案的可能性要小得多,并且产生的审稿引导修正也更少。这些结果表明,审稿人的检测质量和批评采纳在经验上是可分离的。在匹配的PER干预中,强制显式确认会降低最终准确率,而将审稿指导直接嵌入求解者的工作上下文部分改善了后续执行,但未能缩小差距。总体而言,以审稿人为中心的评估可能夸大系统质量:一个协议可能很好地发现错误,但如果它不采纳这些批评意见,仍然无法解决更多问题。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:21

# 精确但脱节:审稿者精度并不能保证多智能体数学推理中批判性意见的采纳  
来源:https://arxiv.org/html/2607.15388  

Chih-Hsuan Yang  
阿贡国家实验室  
&Jingyan Jiang  
阿贡国家实验室  
&Vikram Vasudevan  
俄勒冈州立大学  
Cheng-Hau Yang  
阿贡国家实验室  
&Huihuo Zheng  
阿贡国家实验室  
&Le Chen  
阿贡国家实验室  
Eliu A. Huerta  
阿贡国家实验室  
芝加哥大学  
&Venkatram Vishwanath  
阿贡国家实验室  
&Ian T. Foster  
阿贡国家实验室  
芝加哥大学  
Rajeev Thakur  
阿贡国家实验室  

###### 摘要  

许多近期面向数学和科学的智能体系统采用具有专门审稿者角色的层级化设计,其动机源于这样一种想法:将批判性意见通过专门的审核阶段进行路由,应有助于在难题上将错误候选转化为正确候选。我们在 4,181 个经过验证器验证的 Omni-MATH 问题[7 (https://arxiv.org/html/2607.15388#bib.bib31),2 (https://arxiv.org/html/2607.15388#bib.bib32)](一个带有足够区分空间的十级难度基准)上研究这一期望,使用 matched-gpt-oss-120b 智能体作为主要的智能体家族。在第 1-2 级,多智能体协作最多比匹配的单智能体基线高出约 2 个百分点。从第 4 级开始,增益急剧增加,在第 6-9 级达到约 10 到 20 个百分点。在此范围内,广播式同行讨论比规划者-执行者-审稿者流水线(PER)获得更高的最终准确率。我们以此差异作为起始观察,并探究审稿者质量何时转化为有效的求解器更新。在该基准上,PER 与广播的准确率差距不能仅由审稿者精度解释。这里的*审稿者精度*询问审稿者警告真正指出真实错误的频率。PER 的审稿者具有更高的精度(0.861 vs. 0.644),但正确的批判性意见改变协议下一个候选结果的可能性要小得多,并且审稿者引导的修复率也相应较低。这些结果表明,审稿者的检测质量与批判性意见的采纳在经验上是可分离的。在匹配的 PER 干预措施中,强制显式确认反而降低最终准确率而非改善跟进,而将审稿者指导直接置于求解器的工作上下文中则部分改善了跟进,但未能弥合差距。综合来看,这些干预措施指向同一方向:当批判性意见更直接地呈现在求解器的工作上下文中时,似乎更有可能被采纳,尽管这一证据是方向性的而非因果性的。在以审稿者为中心的评价下,一个系统可能在发现错误方面表现强势,但若协议不采纳这些批判性意见,它仍然无法解决更多问题。

## 1 引言  

#### 常见设计选择:使用专门的审稿者。  
近期关于大语言模型推理的研究已从单链提示转向更丰富的推理时系统,包含多个交互调用、分支或智能体[6 (https://arxiv.org/html/2607.15388#bib.bib1),30 (https://arxiv.org/html/2607.15388#bib.bib6),13 (https://arxiv.org/html/2607.15388#bib.bib7),25 (https://arxiv.org/html/2607.15388#bib.bib2),35 (https://arxiv.org/html/2607.15388#bib.bib13)]。在此更广阔的图景中,开放同行讨论——即智能体公开批评和修改共享候选结果——仍然具有影响力[6 (https://arxiv.org/html/2607.15388#bib.bib1),29 (https://arxiv.org/html/2607.15388#bib.bib38)],但许多近期面向数学和科学的系统采用具有专门审稿者角色的层级化设计。MALT[18 (https://arxiv.org/html/2607.15388#bib.bib36)]将推理分解为生成器、验证器和精炼智能体,并进行端到端训练;DPSDP[34 (https://arxiv.org/html/2607.15388#bib.bib37)]通过强化学习训练智能体-评论家对;近期的综述和规模分析认为,角色异质性可能是多智能体增益的主要来源[22 (https://arxiv.org/html/2607.15388#bib.bib45),11 (https://arxiv.org/html/2607.15388#bib.bib48),9 (https://arxiv.org/html/2607.15388#bib.bib10)]。在这些系统中,一个常见的操作期望是,将批判性意见通过专门的审核阶段进行路由,应能改善修复——即将错误候选转化为正确候选——特别是在难题上。我们将这一更具体的期望称为*角色专门化假设*:当批判性意见重要时,分离审稿者和求解器角色应能改善修复。

#### 隐藏的失败模式:审稿者-求解器耦合。  
这一期望忽略了一个次要问题。审稿者可以正确检测出错误,但下游求解器仍然可能未能采纳该批判性意见。在整篇论文中,*求解器*指产生下一个候选答案的角色;在 PER 中,这是执行者角色。我们将由此产生的失败称为*审稿者-求解器解耦*。如果评估仅报告最终通过率或审稿者精度[8 (https://arxiv.org/html/2607.15388#bib.bib19),24 (https://arxiv.org/html/2607.15388#bib.bib41),14 (https://arxiv.org/html/2607.15388#bib.bib43),3 (https://arxiv.org/html/2607.15388#bib.bib39)],这种失败模式仍然难以检测。我们通过分离审稿者质量与求解器响应来使这种失败可见:在评估者验证有用的批判性意见上,下一个候选结果是否改变,以及该改变是否导致修复?

图1:为何审稿者质量与实现修复可能脱节。在 PER 中,信息流和决策流可能分离:审稿者可以发送正确的警告而不改变下一个候选结果。在广播中,批判性意见嵌入共享候选状态和群体批准,使得旁路在设计上更难实现。

#### 主要发现。  
我们在来自 Omni-MATH 基准家族[7 (https://arxiv.org/html/2607.15388#bib.bib31),2 (https://arxiv.org/html/2607.15388#bib.bib32)]的 4,181 个问题上评估了四种协议,这是一个奥林匹克级别的设定,在当前前沿模型[7 (https://arxiv.org/html/2607.15388#bib.bib31),2 (https://arxiv.org/html/2607.15388#bib.bib32)]下仍有大量改进空间。在最容易的级别上,协作增加很少。然而,一旦基准足够困难以至于协作变得重要,两种协作设计开始分化:广播比 PER 获得更高的最终准确率。我们将此分化作为过程分析的起点:这是否反映了审稿者质量,还是有用的批判性意见未能到达求解器的下一个候选结果?在审稿者的*检测*上,PER 的审稿者比广播的具有更高的精度(0.861 vs. 0.644)。然而,在从批判性意见到行动的*采纳*上,顺序反转:当审稿者给出评估者后来确认有用的批判性意见时,该协议在 PER 中仅 33.6% 的时间改变其承载的候选结果,而在广播中为 93.5%,且审稿者引导修复率为 0.051 对比 0.286。在此评估下,PER 与广播的准确率差距因此不能仅由审稿者精度解释,而是与批判性意见采纳的差异一致。相对于匹配的单智能体迭代基线,协作增益从第 4 级开始急剧增加。我们用三个主要诊断指标来追踪该差距:是否有用的批判性意见被忽略(*忽略率*),下一个答案是否改变(*耦合率*),以及该改变是否修复问题(*审稿者引导修复率*)。在 PER 内部,要求显式确认是一个失败的合规控制。将审稿者指导直接置于求解器工作上下文中的 EMB 仅恢复了 PER-广播差距的一部分,更深层反思变体也是如此。我们将 PER 内部的探测视为这一模式的方向性支持,而非孤立的因果证明。

#### 为何选择 Omni-MATH?  
在标准简单数学基准上,强系统已接近上限,因此很难判断协作是否有帮助。Omni-MATH 为本论文提供了区分协议的空间:它包含 4,181 个竞赛级问题,在当前的评估下远未饱和,并提供了十个基准定义的难度级别,而非针对一个模型家族调整的尺度[7 (https://arxiv.org/html/2607.15388#bib.bib31),2 (https://arxiv.org/html/2607.15388#bib.bib32)]。

#### 单智能体锚点。  
我们相对于*单智能体迭代*来解读级别曲线,这是本文匹配的非协作锚点。单智能体基线已经有迭代机会和验证器交互,因此相对于单智能体的增益可以隔离讨论和审阅所增加的部分,而非将协作与仅仅获得更多尝试的价值混在一起。

#### 声明的范围。  
这是一项*推理时*研究:我们保持底层模型家族固定,并改变推理时使用的协议,包括角色结构、反馈路由和重试行为。我们的声明不是某种协议普遍胜出,也不是 PER 与广播的对比单独隔离了一个因果变量。PER 与广播的比较是关于完整协议设计的证据,这些设计在共享状态、批准规则和讨论结构上有所不同。在此比较中,审稿者精度和批判性意见采纳可以在常见的 PER 风格审稿者-求解器界面下急剧分离;PER 内部的探测提供了关于反馈传递如何与采纳差距相关的更有限的方向变化证据。附录包含更完整的恢复、成本和协议控制细节:跨评估者不一致性重放、更高成本的 PER-inner6 压力测试,以及使用 Gemma 3 智能体的缩小跨家族复制,其中整体排名发生变化但精度-采纳分离仍然存在,表明采纳是一个重要的评估轴而非协议质量的完整说明。

#### 贡献。  
我们做出四项综合贡献:  
1. **发现**。在此匹配的基准/模型设置中,层级化 PER 比广播获得更低的修复率和更低的最终准确率,尽管 PER 的审稿者具有更高的精度;最明显的可观察差异是有用批判性意见的采纳率低得多。  
2. **干预措施**。保持模型家族、审稿者骨干和预算固定的 PER 内部探测提供了与界面故事一致的方向性证据:要求显式确认是一个失败的合规控制,而 EMB 通过将审稿者指导直接置于求解器的工作上下文中部分恢复了差距。  
3. **度量**。我们引入一个度量框架,将尝试内审阅与验证器引导的修复分离,同时结合耦合敏感指标,使得在匹配的协议比较下检测、采纳和实现修复可测量。  
4. **启示**。相同的分析将评估从仅关注审稿者质量转向协议是否采纳批判性意见,而附录为该基准场景提供了考虑验证器成本的部署观点,而非普遍的协议优胜者。

## 2 相关工作  

#### 推理时结构与多智能体推理。  
先前工作表明,当推理获得更多结构时——无论是通过有意推理轨迹、分支搜索还是多智能体交互——推理可以改善[28 (https://arxiv.org/html/2607.15388#bib.bib3),27 (https://arxiv.org/html/2607.15388#bib.bib4),32 (https://arxiv.org/html/2607.15388#bib.bib5),6 (https://arxiv.org/html/2607.15388#bib.bib1),30 (https://arxiv.org/html/2607.15388#bib.bib6),13 (https://arxiv.org/html/2607.15388#bib.bib7)]。在多智能体系统中,开放同行讨论仍然具有影响力,但近期面向数学和科学的系统通常转向专门化或层级化的角色分配[18 (https://arxiv.org/html/2607.15388#bib.bib36),34 (https://arxiv.org/html/2607.15388#bib.bib37),22 (https://arxiv.org/html/2607.15388#bib.bib45),11 (https://arxiv.org/html/2607.15388#bib.bib48),9 (https://arxiv.org/html/2607.15388#bib.bib10)]。本文聚焦于此趋势中的一个狭窄问题:当系统包含专门审稿者时,审稿者质量本身是否足以预测协作是否有帮助?

#### 协作价值。  
近期的智能体评估也提出了更广泛的观点:添加交互或额外智能体本身并非有用,除非协作相对于匹配的非协作基线改善结果,并且以可接受的协调或验证器成本实现[15 (https://arxiv.org/html/2607.15388#bib.bib9),9 (https://arxiv.org/html/2607.15388#bib.bib10),11 (https://arxiv.org/html/2607.15388#bib.bib48)]。本文直接采用此视角。我们不仅通过绝对准确率比较协作协议,还比较相对于单智能体迭代的增益(后者已有重试机会和验证器交互)。这使我们不仅能询问协议是否解决更多问题,还能询问讨论本身是否增加价值以及通过哪个阶段实现该价值。

#### 自我修正、验证器引导的修复与可分离阶段。  
另一条工作线表明,检测、修订和成功修复并非同一事件[16 (https://arxiv.org/html/2607.15388#bib.bib15),23 (https://arxiv.org/html/2607.15388#bib.bib16),24 (https://arxiv.org/html/2607.15388#bib.bib41),1 (https://arxiv.org/html/2607.15388#bib.bib47),8 (https://arxiv.org/html/2607.15388#bib.bib19),14 (https://arxiv.org/html/2607.15388#bib.bib43)]。这些结果很重要,因为它们将评估从“注意到错误就已经完成了大部分工作”的假设中移开。我们将此逻辑扩展到多智能体审稿者-求解器界面:审稿者可以识别有效问题,但下游求解器仍然可能未能将该批判性意见转化为更好的下一个候选结果。

#### 过程感知评估。  
近期的评估工作也认为,仅凭答案指标会遗漏重要的过程差异,特别是在交互、成本和评估器设计都很重要的智能体系统中[19 (https://arxiv.org/html/2607.15388#bib.bib23),15 (https://arxiv.org/html/2607.15388#bib.bib9),9 (https://arxiv.org/html/2607.15388#bib.bib10)]。我们的贡献比基准或分类学论文更狭窄。我们聚焦于评估者验证的有用批判性意见,并询问三个关联问题:批判性意见是否正确,它是否改变了下一个候选结果,以及该改变是否修复了问题?附录G (https://arxiv.org/html/2607.15388#A7)提供了更完整的文献地图和术语谱系。

## 3 任务设定与评估  

### 3.1 基准:Omni-MATH 2  

我们使用 Omni-MATH 2[2 (https://arxiv.org/html/2607.15388#bib.bib32)],这是 Omni-MATH[7 (https://arxiv.org/html/2607.15388#bib.bib31)]的清洁和过滤版本。我们的过滤语料库包含 4,181 个竞赛级数学问题,分为十个基准提供的难度级别,第 10 级最难。每个问题都包含评估者可用的最终答案和参考素材,这使我们能够研究经过验证器验证的恢复,而非自由形式评判者偏好。此基准在此有两个用处。首先,它在当前评估下远未饱和[7 (https://arxiv.org/html/2607.15388#bib.bib31),2 (https://arxiv.org/html/2607.15388#bib.bib32)],因此协议差异在首次通过和多次尝试结果上仍有显现空间。其次,基准提供的级别结构使我们能够询问协作在*哪里*起作用,而不仅仅是哪个协议具有最高聚合得分。因此,我们将 Omni-MATH 用作一个困难设置,在此设置中审稿者精度、批判性意见采纳和验证器引导的修复可以分离。级别数量及更广泛的文献背景推至附录J (https://arxiv.org/html/2607.15388#A10)和附录O (https://arxiv.org/html/2607.15388#A15)。

### 3.2 任务设定  

我们研究经过验证器门控的数学推理

相似文章

评估智能体非常困难

Reddit r/AI_Agents

本文讨论了评估基于LLM的智能体执行多步推理的挑战,指出仅对最终输出进行评分是不够的,因为智能体可能走错路径但偶然恢复,并提出了如何在不手动审查的情况下评估轨迹的问题。

智能体给出的正确答案不代表它做对了事

Reddit r/AI_Agents

本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。