process-reward-models

标签

Cards List
#process-reward-models

过程奖励模型的质量-多样性压力测试:存档覆盖能证明什么,不能证明什么

arXiv cs.LG · 5小时前 缓存

本文将PRM压力测试表述为使用MAP-Elites的质量-多样性搜索问题,刻画了存档覆盖可以证明和不能证明的内容。在Qwen2.5-Math-PRM-7B上的实验揭示了依赖聚合方式的漏洞,且LoRA修复协议降低了利用率。

0 人收藏 0 人点赞
#process-reward-models

从正确性到效用:基于增益的LLM推理前缀评估

arXiv cs.CL · 2026-06-08 缓存

本文介绍了前缀效用模型(PUM),该模型基于前缀的效用(解题率的提升)而非局部正确性来评估LLM推理前缀。PUM在数学推理任务中的选择、搜索和强化学习方面表现出色。

0 人收藏 0 人点赞
#process-reward-models

分布过程奖励模型:通过条件最优传输校准未来奖励的预测

arXiv cs.LG · 2026-05-11 缓存

本文引入了分布过程奖励模型,利用条件最优传输对 PRM 进行校准,以提高推理时缩放(inference-time scaling)中成功概率估计的准确性。该研究在 MATH-500 和 AIME 等数学推理基准测试中展示了改进的校准效果和下游性能。

0 人收藏 0 人点赞
#process-reward-models

无监督过程奖励模型

Hugging Face Daily Papers · 2026-05-11 缓存

本文提出无监督过程奖励模型(uPRM),通过利用LLM的下一个令牌概率识别错误推理步骤,从而消除人工标注需求,在准确率上相比LLM-as-a-Judge提升高达15%,并且作为验证器和奖励信号时表现与有监督PRM相当。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈