超越熵:通过对比策略优化的正确性感知优势塑造
摘要
本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。
查看缓存全文
缓存时间: 2026/07/20 09:39
论文页面 - 超越熵:通过对比策略优化实现正确性感知的优势塑形
来源:https://huggingface.co/papers/2607.14614
摘要
基于可验证奖励的强化学习(RLVR)通常使用熵进行优势塑形。然而,熵无法区分有益的不确定性与有害的混淆,限制了其作为正确性信号的有效性。我们提出对比策略优化(CPO),该方法利用参考引导分布与普通生成分布在词元层面的对比分歧,进行正确性感知的优势塑形。理论和实验结果均表明,这种分歧能可靠地指示词元级别的正确性。我们进一步证明,在线蒸馏是CPO的一个特例,其中后验分布由外部教师模型实例化。CPO同时还解决了零优势问题。在域内和域外基准测试上的实验表明,CPO在保持强大泛化能力的同时,显著优于基于熵的RLVR方法。进一步分析显示,正确和错误的回答分别自然支持探索和利用,而平衡两者可带来最佳性能。
查看 arXiv 页面 (https://arxiv.org/abs/2607.14614)查看 PDF (https://arxiv.org/pdf/2607.14614)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14614)
在您的智能体中获取此论文:
hf papers read 2607.14614
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.14614 以在此页链接该论文。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.14614 以在此页链接该论文。
引用此论文的 Space0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.14614 以在此页链接该论文。
包含此论文的收藏集0
没有包含此论文的收藏集
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以在此页链接该论文。
相似文章
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
提出了面向纠正的策略优化(CIPO),这是对RLVR的一种扩展,它将失败轨迹转化为面向纠正的监督信号,从而在数学和代码基准测试中提升LLM的推理与纠错能力。
Contrastive Branch Policy Optimization
CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。
用于离散策略优化的引导对比Token信用分配
本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。
CEPO:基于对比证据策略优化的RLVR自我蒸馏
CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。
组熵控制策略优化
本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。