CEPO:基于对比证据策略优化的RLVR自我蒸馏

Hugging Face Daily Papers 论文

摘要

CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。

当模型在基于可验证奖励的强化学习(RLVR)下产生正确解时,每个令牌都收到同样的奖励信号,无论它是关键推理步骤还是语法填充。一个自然的修复方法是让模型以正确答案为教师进行条件化,识别出如果模型事先知道答案就会不同生成的令牌。先前的工作表明,这要么会将答案泄露到梯度中从而破坏训练,要么产生一个弱信号,无法区分关键步骤和填充,因为两者相对于模型的基线看起来同样令人惊讶。 我们提出对比证据策略优化(CEPO),它在每个令牌处提出更尖锐的问题:不仅仅是“正确答案是否支持这个令牌?”,而是“正确答案支持它同时错误答案不支持它?”满足两者的令牌是真正的推理步骤;两者都不满足的是填充。错误答案教师从训练批次中已有的拒绝轨迹构建,不产生额外采样成本。我们证明CEPO继承了先前最先进方法的所有结构性安全保障,同时在关键令牌处严格强化信用分配,改进在填充位置恰好消失。 实证结果表明,在相同训练预算下,CEPO在五个多模态数学推理基准上分别达到43.43%和60.56%的平均准确率(2B和4B规模),而GRPO为41.17%和57.43%。分布匹配的自我蒸馏方法(OPSD、SDPO)低于未训练基线,实证证实了我们理论预测的信息泄露。我们的代码可在 https://github.com/ahmedheakl/CEPO 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/20 02:35

论文页面 - CEPO: 使用对比证据策略优化的RLVR自蒸馏

来源:https://huggingface.co/papers/2605.19436

摘要

对比证据策略优化(CEPO)通过从被拒绝的轨迹(rejected rollouts)中提取的对比教学信号,来区分关键推理步骤与填充词元,从而改进带可验证奖励的强化学习(RLVR)。

当模型在RLVR(https://huggingface.co/papers?q=reinforcement%20learning%20with%20verifiable%20reward)下生成正确答案时,每个词元(token)都会收到相同的奖励信号,无论它是关键推理步骤还是语法填充词。一个自然的修复方法是让模型以正确答案作为教师,识别出如果它事先知道答案,会以不同方式生成的词元。但先前的工作表明,这要么将答案泄露到梯度中从而破坏训练,要么产生一个无法区分关键步骤与填充词的弱信号——因为两者相对于模型基线都显得同样意外。我们提出了对比证据策略优化(CEPO)(https://huggingface.co/papers?q=Contrastive%20Evidence%20Policy%20Optimization),它在每个词元处提出一个更精准的问题:不仅要问“正确答案是否倾向于这个词元?“,还要问“正确答案是否倾向于它,同时错误答案是否排斥它?“一个同时满足这两个条件的词元是真正的推理步骤;两个都不满足的则是填充词。错误答案教师由训练批次中已有的被拒绝轨迹(https://huggingface.co/papers?q=rejected%20rollouts)构建,不产生额外的采样成本。我们证明了CEPO继承了先前最先进方法的所有结构安全保证,同时严格增强了关键词元的信用分配,而在填充词位置上的改进恰好消失。实验上,在五个多模态数学推理(https://huggingface.co/papers?q=multimodal%20mathematical%20reasoning)基准测试中,2B和4B规模的CEPO分别实现了43.43%和60.56%的平均准确率,而GRPO在相同训练预算下分别为41.17%和57.43%。分布匹配自蒸馏方法(OPSD、SDPO)的表现低于未训练基线,这从实验上证实了我们理论预测的信息泄露。我们的代码开源在 https://github.com/ahmedheakl/CEPO。

查看arXiv页面(https://arxiv.org/abs/2605.19436) 查看PDF(https://arxiv.org/pdf/2605.19436) GitHub2(https://github.com/ahmedheakl/CEPO) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.19436)

在你的Agent中获取这篇论文:

hf papers read 2605.19436

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2605.19436,以从该页面链接到它。

引用该论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2605.19436,以从该页面链接到它。

引用该论文的Spaces0

没有Space链接此论文

请在Space README.md中引用arxiv.org/abs/2605.19436,以从该页面链接到它。

包含该论文的收藏集0

没有收藏集包含此论文

请将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中,以从该页面链接到它。

相似文章

超越熵:通过对比策略优化的正确性感知优势塑造

Hugging Face Daily Papers

本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。

面向强化学习后训练的跨轮次自适应展开优化

arXiv cs.LG

本文提出了CERO,一种用于LLM强化学习后训练的跨轮次自适应展开优化方法。该方法利用贝叶斯后验方差,在提示和轮次之间分配固定的展开预算,以最大化样本效率,实现了理论遗憾界,并在数学推理任务上优于GRPO。

不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化

arXiv cs.AI

本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。