SCI-PRM:一种面向科学推理验证的工具感知过程奖励模型

arXiv cs.AI 论文

摘要

# SCI-PRM:面向科学推理的工具感知过程奖励模型 SCI-PRM 提出了一种面向科学推理的工具感知过程奖励模型(Process Reward Model),基于 SCIPRM70K 数据集训练而成。该数据集包含"Chain-of-Tool"轨迹,将推理过程与科学工具的调用执行交织融合。SCI-PRM 能够实现高效的测试时扩展(test-time scaling),并作为强化学习中的密集奖励信号(dense reward signal),在科学基准测试的工具调用步骤上超越了 GPT-5-Mini 等专有模型。

arXiv:2606.04579v1 公告类型:新论文 摘要:尽管过程奖励模型(PRM)在数学推理领域取得了显著成就,但其在复杂科学领域(如生物学、化学和物理学)中的应用仍有待深入探索。科学问题不仅需要严密的逻辑推理,还要求事实一致性以及对领域专用工具的精确使用,而现有模型在这些方面往往存在幻觉问题且缺乏有效验证。在本文中,我们首先构建了 SCIPRM70K——一个大规模数据集,其特色在于包含链式工具调用轨迹,将推理过程与科学工具的执行显式交织在一起。在此基础上,我们训练了一个高效的奖励模型 Sci-PRM,能够在单次推理中对每个步骤的工具选择、执行准确性和结果解释提供细粒度的监督信号。实验表明,Sci-PRM 在两个关键方面显著增强了基础模型的能力:(1)通过 Best-of-N 选择实现有效的测试时扩展;(2)当融入强化学习时,作为密集奖励信号,有效缓解了优势消失这一关键问题,使模型得以突破现有的性能上限。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:08

# Sci-PRM:面向科学推理验证的工具感知过程奖励模型

来源:https://arxiv.org/html/2606.04579

Xiangyu Zhao¹·²、Hengyuan Zhao³、Yiheng Wang²·⁴、Wanghan Xu²·⁴、Yuhao Zhou²·⁵、Qinglong Cao²·⁴、Zhiwang Zhou²·⁶、Lei Bai²、Wenlong Zhang²✉、Xiao-Ming Wu¹✉

¹香港理工大学 ²上海人工智能实验室 ³新加坡国立大学 ⁴上海交通大学 ⁵四川大学 ⁶同济大学

[email protected][email protected]
[email protected][email protected]

###### 摘要

尽管过程奖励模型(PRMs)在数学推理领域取得了显著成功,但其在复杂科学领域(如生物学、化学和物理学)中的应用仍在很大程度上尚未开发。科学问题不仅需要严格的逻辑推理,还需要事实一致性以及领域专用工具的精确使用,而现有模型在这些方面常常存在幻觉问题且缺乏有效验证。本文首先构建了 SCIPRM70K——一个大规模数据集,包含"工具链"(Chain-of-Tool)轨迹,将推理过程与科学工具的执行显式交织在一起。在此基础上,我们训练了一个高效的奖励模型 Sci-PRM,能够在单次推理中对每个步骤的工具选择、执行准确性和结果解释提供细粒度监督。实验表明,Sci-PRM 在两个关键方面显著增强了基础模型:(1)通过 Best-of-N 选择实现有效的测试时扩展;(2)集成到强化学习中时,作为密集奖励信号,缓解了优势消失这一关键问题,使模型能够突破现有的性能天花板。Sci-PRM 已公开发布,以促进进一步的研究与创新:https://github.com/InternScience/Sci-PRM。

参见图注:图 1:不同评判模型作为过程奖励在四个科学基准上的步骤级 F1 分数,按当前步骤是否包含工具调用分类展示。最先进的专有模型 GPT-5-Mini 在非工具调用步骤上差距较小,但在工具调用步骤上性能明显下降。相比之下,基于我们精心整理数据训练的 Sci-PRM(本文方法)在两类步骤上均保持高精度,突显了其在科学领域的优势和专业性。

## 1 引言

大型语言模型(LLMs)\(Singh et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib1); Google, 2025 (https://arxiv.org/html/2606.04579#bib.bib2); Yang et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib3)\) 越来越多地被用作评估器,在训练和测试时提供反馈,这一范式通常被称为*LLM-as-a-Judge*。在这一研究方向中,奖励建模方法通常分为两类:*结果监督奖励模型*(ORMs)——仅评估最终答案;以及*过程监督奖励模型*(PRMs)——对中间推理步骤提供监督。ORMs 因其简单性和可扩展性而颇具吸引力,但它们可能对"结果正确但推理有误"的输出给予高奖励\(Wen et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib6); Weng, 2024 (https://arxiv.org/html/2606.04579#bib.bib7)\),即所谓的"假阳性"\(Yuan et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib5)\)(例如奖励欺骗、侥幸正确步骤),从而强化不可靠的响应。

参见图注:图 2:Sci-PRM(本文方法)与标准验证器的对比。Sci-PRM 无需执行开销即可高效检测代码逻辑缺陷(上),并能准确识别文献检索中的引用幻觉(下)。

尽管取得了上述进展,PRM 在*科学推理*领域尚未得到系统性发展。生物学\(Liu et al., 2021 (https://arxiv.org/html/2606.04579#bib.bib29)\)、化学\(Zhang et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib30)\)、物理学\(Feng et al., 2025b (https://arxiv.org/html/2606.04579#bib.bib32)\)和地球科学\(Zhao et al., 2025b (https://arxiv.org/html/2606.04579#bib.bib31); Zhou et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib65); Feng et al., 2025c (https://arxiv.org/html/2606.04579#bib.bib68)\)中的科学推理与纯数学推理\(Patel et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib9); Shao et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib8); Yang et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib13)\)存在本质区别。正确性不仅依赖于符号化计算结果,更依赖于以证据为基础的推理,这种推理必须与领域知识、物理约束、实验测量以及快速演进的事实数据库保持一致。因此,LLMs 频繁表现出*领域特异性幻觉*:它们可能生成听起来合理但实际上与已知科学*不一致*的机制、参数或引用。

值得注意的是,许多科学问题天然具有*工具可验证性*:模型可以访问分子属性数据库、基因/蛋白质序列比对工具、方程求解器、单位转换器或文献检索系统来验证中间声明。如图 1 所示,GPT-5-Mini 等通用评判模型在普通推理步骤上能保持合理的准确率,但在评估涉及科学工具调用步骤的轨迹时*明显退化*。这一差距突显了对领域专用过程评判模型的需求。然而,现有的 PRM\(Zou et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib10); Wang et al., 2025a (https://arxiv.org/html/2606.04579#bib.bib44); Zhang et al., 2025c (https://arxiv.org/html/2606.04579#bib.bib14); She et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib15)\) 流程很少整合此类工具,且大多数面向工具的奖励建模工作\(Qian et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib21); Li et al., 2025b (https://arxiv.org/html/2606.04579#bib.bib17); Xi et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib18); Wu et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib19)\)主要聚焦于通用领域,而非科学推理。

与此同时,工具增强的 LLMs(Singh et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib1);Google, 2025 (https://arxiv.org/html/2606.04579#bib.bib2);Zhao et al., 2026 (https://arxiv.org/html/2606.04579#bib.bib60);Ling et al., 2026 (https://arxiv.org/html/2606.04579#bib.bib61);Xu et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib66))已成为提升可靠性的有前景方案。通过将计算和事实验证委托给外部工具,LLMs 可以减少幻觉并获得更可信的答案。近期的奖励建模研究已开始探索工具使用\(Qian et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib21); Li et al., 2025b (https://arxiv.org/html/2606.04579#bib.bib17)\),证明专门的奖励模型能比前沿通用 LLM 评判者\(Zheng et al., 2023 (https://arxiv.org/html/2606.04579#bib.bib22)\)更好地评判函数调用轨迹。然而,这些工作大多面向通用工具环境\(Dong et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib20); Gou et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib23); Agarwal et al., 2026 (https://arxiv.org/html/2606.04579#bib.bib24)\)(例如计算器、网络搜索、简单 API),并强调响应级别的偏好。

科学推理面临*额外挑战*:(1)工具的选择必须与科学子问题相匹配;(2)调用必须正确,包括单位、格式和领域特定参数;(3)工具输出的解释和利用必须保留约束条件和不确定性。无法区分这些失败模式的奖励模型,对训练或测试时选择所提供的信号十分有限。

如图 2 所示,我们的分析将 Sci-PRM 与通用评判模型进行了比较,评估内容涉及网络搜索和代码执行等常用科学工具的评估能力。比较结果突显了科学领域对工具使用的严格性要求远高于通用领域。例如,使用集成搜索工具的 LLMs 经常遭受"引用幻觉"——生成听起来合理但错误地将论文标题映射到 DOI 的内容——而通用验证器往往无法准确定位此类错误。另一方面,使用基于代码的工具非常耗时。调用科学 API(例如用于蛋白质比对的 BLAST 或用于分子处理的 RDKit)每次运行通常需要 1-5 分钟,这使其在测试时扩展或作为强化学习(RL)中的高效奖励信号时并不实用。这凸显了对 Sci-PRM 这类专用过程奖励模型的迫切需求——它能够提供快速、准确的验证,以推动科学 LLMs 的发展。

我们提出 **Sci-PRM**,一种*工具感知过程奖励模型*,专为通过领域工具逐步评判科学推理而设计。Sci-PRM 在新构建的数据集 SCIPRM70K 上进行训练,该数据集包含多学科科学问题及其配套推理轨迹,轨迹中同时包含*思维链*(chain-of-thought)和*工具链*(chain-of-tool)(即显式的科学工具调用、工具输出及有依据的解释)。为实现可扩展的监督,我们引入了一个自动化的步骤级标注流程,为每个推理步骤和工具使用步骤分配细粒度质量标签。特别地,对于与工具相关的步骤,我们标注三个维度:(1)**工具选择正确性**(所选工具是否合适?),(2)**工具调用准确性**(参数和约束是否正确?),以及(3)**结果有效性与利用**(返回的证据是否被正确解释并在下游使用?)。这些标签使 Sci-PRM 能够生成可靠的标量奖励,捕捉科学推理失败的位置和方式。

在实验阶段,我们在测试时扩展和 RL 训练中均使用 Sci-PRM 来验证其有效性。在测试时扩展阶段,给定一个新问题,基础模型生成多个候选解决方案轨迹(例如 Best-of-N 采样)。Sci-PRM 对每个步骤评分并聚合轨迹级奖励以选择最可靠的路径,减少"假阳性和证据不一致的推理"。我们在涵盖多个学科的代表性科学推理基准上测试 Sci-PRM,结果表明工具感知过程监督相比仅使用结果评判和通用工具使用评论者取得了一致性提升,在需要多步验证的问题上尤为突出。

总结而言,我们的贡献如下:

- **工具增强的科学数据集 SCIPRM70K。** 我们构建了一个多领域具有挑战性的科学问题数据集,包含显式交织推理步骤和结构化工具调用(*工具链*)的轨迹,支持基于证据的推理的监督学习。
- **科学工具使用的细粒度步骤级监督。** 我们提出了一个自动化标注框架,能够区分工具选择、调用和结果利用错误,在数学领域之外提供可扩展的过程监督。
- **Sci-PRM:工具感知过程奖励模型。** 我们训练了一个奖励模型,能够对部分科学推理轨迹评分,并支持测试时选择和自我修正,提升可靠性并减少幻觉。
- **科学推理的实证提升。** 在多样化基准上,与 ORM 式评判者和通用工具使用奖励模型相比,Sci-PRM 提升了准确率和事实一致性,证明了工具感知过程监督在科学领域的价值。

## 2 相关工作

### 2.1 过程监督奖励建模

奖励建模是将 LLMs 与人类价值观和逻辑一致性对齐的核心基础\(Ouyang et al., 2022 (https://arxiv.org/html/2606.04579#bib.bib4)\)。早期方法主要依赖仅评估最终响应的结果监督奖励模型(ORMs),近期研究已转向过程监督奖励模型(PRMs)\(Zou et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib10); Uesato et al., 2022 (https://arxiv.org/html/2606.04579#bib.bib12); Zhang et al., 2025c (https://arxiv.org/html/2606.04579#bib.bib14); She et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib15); Wang et al., 2025a (https://arxiv.org/html/2606.04579#bib.bib44)\)。PRMs 对中间推理步骤提供细粒度反馈,已被证明能显著减少逻辑错误和幻觉,优于 ORMs\(Lightman et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib11); Wang et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib25)\)。这种细粒度监督在具有结构化逻辑的领域(如数学和代码生成)中被证明尤为有效。然而,现有的 PRM 研究\(Qian et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib21); Li et al., 2025b (https://arxiv.org/html/2606.04579#bib.bib17); Xi et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib18); Wu et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib19)\)主要聚焦于通用领域的推理。在生物医学、化学和地球科学等专业科学领域中对过程监督的研究明显不足——这些领域的推理不仅需要逻辑连贯性,还需要严格遵守物理定律和实验事实。

### 2.2 工具增强推理与评估

为克服参数化知识的局限性(Wang et al., 2025b (https://arxiv.org/html/2606.04579#bib.bib64);Liu et al., 2025b (https://arxiv.org/html/2606.04579#bib.bib67)),研究者将外部工具集成到 LLMs 中\(Schick et al., 2023 (https://arxiv.org/html/2606.04579#bib.bib34); Qin et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib35)\),从而支持网络浏览和代码执行等能力。在评估方面,近期研究探索了"工具辅助评判者"以增强奖励模型的可靠性。例如,Math-Shepherd\(Wang et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib25)\)等方法虽然对通用计算任务有效,但通常依赖通用工具(如计算器或搜索引擎),且往往采用提示策略,而非训练奖励模型以内在地验证工具使用。近期还提出了自主工具构建方法\(Liu et al., 2024 (https://arxiv.org/html/2606.04579#bib.bib52)\)。关键的是,现有工具增强评估器缺乏验证科学工作流的专业能力,例如通过 RDKit 验证分子属性或通过 Biopython 进行序列比对。因此,它们往往无法检测参数选择或复杂科学数据误解释中的领域特定错误。

### 2.3 面向科学推理的强化学习

强化学习(RL)近期被用于增强科学推理(Zou et al., 2026 (https://arxiv.org/html/2606.04579#bib.bib59);Rao et al., 2026 (https://arxiv.org/html/2606.04579#bib.bib62);Feng et al., 2026 (https://arxiv.org/html/2606.04579#bib.bib63);Tang et al., 2025 (https://arxiv.org/html/2606.04579#bib.bib69);Bai et al., 2025a (https://arxiv.org/html/2606.04579#bib.bib70))和工具集成推理。训练模型将推理与执行交织进行的策略在 GSM8K\(Cobbe et al., 2021 (https://arxiv.org/html/2606.04579#bib.bib26)\)等基准上展示了提升性能的潜力。然而,现有大多数方法依赖"循环执行"范式,即模型在 RL 训练过程中必须执行工具并接收反馈(例如通过 PPO\(Schulman et al.,

相似文章

无监督过程奖励模型

Hugging Face Daily Papers

本文提出无监督过程奖励模型(uPRM),通过利用LLM的下一个令牌概率识别错误推理步骤,从而消除人工标注需求,在准确率上相比LLM-as-a-Judge提升高达15%,并且作为验证器和奖励信号时表现与有监督PRM相当。

科学写作评估的奖励建模

arXiv cs.CL

本文提出 SciRM,一种经济高效的开源奖励模型,通过两阶段训练框架专门用于评估科学写作,该框架优化了评估偏好和推理能力。这些模型可以泛化到多种科学写作任务,无需任务特定的重新训练,解决了现有基于 LLM 的评判器在特定领域评估标准上的局限性。

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。