contrast-augmented-reward

标签

Cards List
#contrast-augmented-reward

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI ↗ · 2026-08-05 缓存

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈