CEPO:基于对比证据策略优化的RLVR自我蒸馏
摘要
CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。
查看缓存全文
缓存时间: 2026/05/20 02:35
论文页面 - CEPO: 使用对比证据策略优化的RLVR自蒸馏
来源:https://huggingface.co/papers/2605.19436
摘要
对比证据策略优化(CEPO)通过从被拒绝的轨迹(rejected rollouts)中提取的对比教学信号,来区分关键推理步骤与填充词元,从而改进带可验证奖励的强化学习(RLVR)。
当模型在RLVR(https://huggingface.co/papers?q=reinforcement%20learning%20with%20verifiable%20reward)下生成正确答案时,每个词元(token)都会收到相同的奖励信号,无论它是关键推理步骤还是语法填充词。一个自然的修复方法是让模型以正确答案作为教师,识别出如果它事先知道答案,会以不同方式生成的词元。但先前的工作表明,这要么将答案泄露到梯度中从而破坏训练,要么产生一个无法区分关键步骤与填充词的弱信号——因为两者相对于模型基线都显得同样意外。我们提出了对比证据策略优化(CEPO)(https://huggingface.co/papers?q=Contrastive%20Evidence%20Policy%20Optimization),它在每个词元处提出一个更精准的问题:不仅要问“正确答案是否倾向于这个词元?“,还要问“正确答案是否倾向于它,同时错误答案是否排斥它?“一个同时满足这两个条件的词元是真正的推理步骤;两个都不满足的则是填充词。错误答案教师由训练批次中已有的被拒绝轨迹(https://huggingface.co/papers?q=rejected%20rollouts)构建,不产生额外的采样成本。我们证明了CEPO继承了先前最先进方法的所有结构安全保证,同时严格增强了关键词元的信用分配,而在填充词位置上的改进恰好消失。实验上,在五个多模态数学推理(https://huggingface.co/papers?q=multimodal%20mathematical%20reasoning)基准测试中,2B和4B规模的CEPO分别实现了43.43%和60.56%的平均准确率,而GRPO在相同训练预算下分别为41.17%和57.43%。分布匹配自蒸馏方法(OPSD、SDPO)的表现低于未训练基线,这从实验上证实了我们理论预测的信息泄露。我们的代码开源在 https://github.com/ahmedheakl/CEPO。
查看arXiv页面(https://arxiv.org/abs/2605.19436) 查看PDF(https://arxiv.org/pdf/2605.19436) GitHub2(https://github.com/ahmedheakl/CEPO) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.19436)
在你的Agent中获取这篇论文:
hf papers read 2605.19436
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接此论文
请在模型README.md中引用arxiv.org/abs/2605.19436,以从该页面链接到它。
引用该论文的数据集0
没有数据集链接此论文
请在数据集README.md中引用arxiv.org/abs/2605.19436,以从该页面链接到它。
引用该论文的Spaces0
没有Space链接此论文
请在Space README.md中引用arxiv.org/abs/2605.19436,以从该页面链接到它。
包含该论文的收藏集0
没有收藏集包含此论文
请将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中,以从该页面链接到它。
相似文章
超越熵:通过对比策略优化的正确性感知优势塑造
本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。
CIGPO:用于多轮证据读取LLM智能体的上下文信息增益策略优化
本文识别出GRPO在多轮证据读取智能体中的奖励方差崩溃故障模式,并提出CIGPO方法,该方法使用每轮上下文信息增益奖励来维持梯度信号,在HotpotQA上实现了+105%的F1性能提升。
面向强化学习后训练的跨轮次自适应展开优化
本文提出了CERO,一种用于LLM强化学习后训练的跨轮次自适应展开优化方法。该方法利用贝叶斯后验方差,在提示和轮次之间分配固定的展开预算,以最大化样本效率,实现了理论遗憾界,并在数学推理任务上优于GRPO。
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
提出了面向纠正的策略优化(CIPO),这是对RLVR的一种扩展,它将失败轨迹转化为面向纠正的监督信号,从而在数学和代码基准测试中提升LLM的推理与纠错能力。
不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化
本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。