超越熵:通过对比策略优化的正确性感知优势塑造

Hugging Face Daily Papers 论文

摘要

本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。

可验证奖励的强化学习(RLVR)通常使用熵进行优势塑造。然而,熵无法区分有用的不确定性和有害的混乱,限制了其作为正确性信号的有效性。我们提出了对比策略优化(CPO),它利用参考引导和普通生成分布之间的token级对比差异进行正确性感知的优势塑造。理论和实证结果均表明,这种差异可靠地指示了token级正确性。我们进一步证明,在线策略蒸馏是CPO的一个特例,其中后验分布由外部教师模型实例化。CPO还解决了零优势问题。在域内和域外基准上的实验表明,CPO在保持强泛化能力的同时,显著优于基于熵的RLVR方法。进一步分析表明,正确和错误的回答分别自然地支持探索和利用,平衡两者可达到最佳性能。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:39

论文页面 - 超越熵:通过对比策略优化实现正确性感知的优势塑形

来源:https://huggingface.co/papers/2607.14614

摘要

基于可验证奖励的强化学习(RLVR)通常使用熵进行优势塑形。然而,熵无法区分有益的不确定性与有害的混淆,限制了其作为正确性信号的有效性。我们提出对比策略优化(CPO),该方法利用参考引导分布与普通生成分布在词元层面的对比分歧,进行正确性感知的优势塑形。理论和实验结果均表明,这种分歧能可靠地指示词元级别的正确性。我们进一步证明,在线蒸馏是CPO的一个特例,其中后验分布由外部教师模型实例化。CPO同时还解决了零优势问题。在域内和域外基准测试上的实验表明,CPO在保持强大泛化能力的同时,显著优于基于熵的RLVR方法。进一步分析显示,正确和错误的回答分别自然支持探索和利用,而平衡两者可带来最佳性能。

查看 arXiv 页面 (https://arxiv.org/abs/2607.14614)查看 PDF (https://arxiv.org/pdf/2607.14614)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14614)

在您的智能体中获取此论文:

hf papers read 2607.14614

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.14614 以在此页链接该论文。

引用此论文的数据集0

没有数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.14614 以在此页链接该论文。

引用此论文的 Space0

没有 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.14614 以在此页链接该论文。

包含此论文的收藏集0

没有包含此论文的收藏集

请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以在此页链接该论文。

相似文章

Contrastive Branch Policy Optimization

arXiv cs.LG

CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。

用于离散策略优化的引导对比Token信用分配

Hugging Face Daily Papers

本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。

CEPO:基于对比证据策略优化的RLVR自我蒸馏

Hugging Face Daily Papers

CEPO通过使用来自拒绝轨迹的对比信号来区分关键推理步骤和填充令牌,从而改进了基于可验证奖励的强化学习,在多模态数学推理基准上相比GRPO获得了更高的准确率。

组熵控制策略优化

Hugging Face Daily Papers

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。