过程奖励模型的质量-多样性压力测试:存档覆盖能证明什么,不能证明什么

arXiv cs.LG 论文

摘要

本文将PRM压力测试表述为使用MAP-Elites的质量-多样性搜索问题,刻画了存档覆盖可以证明和不能证明的内容。在Qwen2.5-Math-PRM-7B上的实验揭示了依赖聚合方式的漏洞,且LoRA修复协议降低了利用率。

arXiv:2608.08008v1 公告类型:新 摘要:过程奖励模型(PRM)对中间推理步骤进行评分,广泛应用于搜索、排序和训练,但优化可以通过增加奖励同时将正确推理转变为错误推理来利用这些学到的代理器。我们将PRM压力测试表述为使用MAP-Elites的质量-多样性搜索问题,在每个行为空间区域中保留最严重的正确性翻转编辑,同时将搜索覆盖与利用覆盖分开。我们刻画了这类存档所能证明的内容:有限单元修复限制了已覆盖单元的尾部风险和平均残余严重性,但仅凭覆盖比例无法限制剩余的最差单元;在Lipschitz修复后损失和度量覆盖审计下,残余由存档拟合误差加上Lipschitz常数乘以覆盖半径来界定。一个受控的景观验证了这一证书,以及任何仅基于比例的最坏情况保证的不可能性。在真实PRM上,搜索揭示了Qwen2.5-Math-PRM-7B中一种依赖聚合方式的漏洞:padding在平均池化下产生44个严格利用,最大增益0.294,而在最小读出下仅产生1个利用;匹配的句法对照隔离了该机制,RLHFlow值头模型显示出相同的定性效果,最大增益0.005。一个预先声明的配对LoRA修复协议将利用率从0.148到0.037再到0.074,将最坏攻击从0.333到0.177再到0.212,提高了排序AUROC而不降低best-of-4准确率,将增益归因于对抗性微调而非存档多样性,并经独立的非配对重复实验确认(44比1,干净分割最坏增益0.0092,MATH-500 41比0,干净排序40/40)。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:09

来源:https://arxiv.org/html/2608.08008

Ibne Farabi Shihab\(^{1\*}\),Fariya Afrin\(^{2\†}\)

\(^1\) Department of Computer Science, Iowa State University  
\(^2\) Department of Computer Science, Kalinga Institute of Industrial Technology  
\* 同等贡献。  
\† 通讯作者:[email protected]。

###### 摘要

过程奖励模型(PRMs)对中间推理步骤进行打分,并被广泛用于搜索、排序和训练。然而,优化过程可能会利用这些学习得到的代理指标:在增加奖励的同时,将原本正确的推理变成错误推理。我们将 PRM 压力测试形式化为一个使用 MAP-Elites 的质量-多样性搜索问题,在每个行为空间区域中保留最严重的“正确性翻转”编辑,同时将搜索覆盖与利用覆盖区分开来。我们刻画了这类档案能够证明什么:有限单元修复界可以约束已覆盖单元的尾部风险和平均残差严重度,但仅凭覆盖比例无法约束最差剩余单元;在 Lipschitz 后修复损失和度量覆盖审计下,残差由档案拟合误差加 Lipschitz 常数乘以覆盖半径界定。一个受控景观验证了这一证书,也验证了任何仅基于比例的 worst-case 保证都不可能成立。在真实 PRM 上,搜索揭示了一个依赖聚合方式的漏洞:Qwen2.5-Math-PRM-7B 在平均池化(mean pooling)下,填充(padding)产生 44 个严格利用样本,最大增益为 0.294;而在最小值读出(minimum readout)下仅产生 1 个利用样本。一个匹配的句法对照将机制分离出来;RLHFlow value-head 模型表现出相同的定性效果,最大增益为 0.005。一个预先声明的配对 LoRA 修复协议将利用率从 0.148 降至 0.037–0.074,将最坏攻击从 0.333 降至 0.177–0.212,提升了排序 AUROC 且不降低 best-of-4 准确率,并将增益归因于对抗性微调而非档案多样性;独立非配对重复实验确认了该结果(4→1,干净划分最坏增益 0.0092,MATH-500 4→1,干净排序 40/40)。

## 1 引言

过程奖励模型已成为现代推理系统的重要组成部分。PRM 不是对完整答案给出单一分数,而是评估中间步骤,提供密集的信号,可用于指导推理时搜索、对候选推导进行排序,或作为训练奖励(Lightman et al., 2024 (https://arxiv.org/html/2608.08008#bib.bib4);Uesato et al., 2022 (https://arxiv.org/html/2608.08008#bib.bib8);Wang et al., 2024 (https://arxiv.org/html/2608.08008#bib.bib9))。其吸引力很直接:步骤级信号可以在两条推理轨迹的最终答案分叉之前就区分它们。然而,同样的细粒度也意味着一个更大的可优化表面,供学习得到的评估器被优化。当 PRM 奖励那些在其训练分布上与正确性相关、但并非正确性本质特征的特征时,搜索或强化学习可能会放大这些特征,而并未改善推理本身。这种失败是结果奖励模型中奖励过度优化(reward over-optimization)的过程级类比(Gao et al., 2023 (https://arxiv.org/html/2608.08008#bib

相似文章

PRM-as-a-Judge 1.5: 机器人流程评估工具包

Hugging Face Daily Papers

PRM-as-a-Judge 1.5 是一款工具包,提供细粒度指标和可靠性工具,用于评估具身机器人模型,超越二元成功率,专注于过程进展和执行质量的评估。

为什么确定性PRM指导在离散扩散推理中表现不佳

Hugging Face Daily Papers

论文显示,在离散扩散语言模型中,当计算资源匹配时,确定性PRM指导的表现不如更简单的基线,识别出两个关键失败:弱的剪枝信号和糟糕的最终判断,并发布了一个语料库和工具包,以便进行可复现的比较。

DEI:进化推断中的多样性用于质量-多样性搜索

Hugging Face Daily Papers

DEI引入了一种分布式质量-多样性搜索框架,使用异构大语言模型(LLMs)作为变异算子,表明模型多样性相比同构并行方法能提升性能。在Core War领域上的评估显示,一个四节点异构集成在QD-Score和覆盖率上取得了显著提升。