并非所有Token都值得同等信用:面向长CoT推理的反事实敏感性信用再分配

Hugging Face Daily Papers 论文

摘要

本文提出反事实敏感性信用再分配(CSCR),这是GRPO的一种简单扩展,可降低高敏感性Token的信用,并重新归一化Token级优势,用于长CoT数学推理。它持续优于GRPO基线,同时揭示特权Token移位方向不可靠,主要反映反事实敏感性而非学习价值。

可验证奖励的强化学习(RLVR)是改进大语言模型长CoT推理的核心。无Critic方法(如GRPO)将响应级奖励转化为优势,并将其均匀广播到所有Token上,忽略了它们对最终结果的不平等贡献。在线策略自蒸馏(OPSD)则通过最小化非特权策略与特权自教师之间的前向KL散度来提供密集的分布监督,隐式假设由此产生的似然偏移编码了可靠的、与答案对齐的信息。我们通过固定每条采样轨迹,并在两种相反的结果条件下重新评分来验证这一前提:一个条件断言正确,另一个断言错误。在两种条件下,大多数受影响的Token朝相同方向偏移,符号反转很少,且诱导的优化信号存在大量重叠。大幅偏移还集中在高可替换的表层形式Token上,而携带特定问题推理内容的Token则不那么敏感。这些发现表明,特权偏移无法提供可靠的与答案对齐的方向,其幅度主要反映反事实敏感性,而非Token级学习价值。基于这些观察,我们提出了反事实敏感性信用再分配(CSCR),这是GRPO的一种简单扩展,可降低高敏感Token的信用,并重新归一化Token级优势,以保留原始信用预算和验证器决定的方向。在长CoT数学推理基准上,CSCR在相同数量的策略更新下持续优于GRPO基线。针对性消融实验进一步印证了我们的诊断:特权诱导的方向不可靠,适度降权最有效,而更强的调节会破坏优化稳定性。
查看原文
查看缓存全文

缓存时间: 2026/08/03 13:32

论文页面 - 并非所有 Token 都值得同等信用:面向 Long-CoT 推理的反事实敏感性信用重新分配

Source: https://huggingface.co/papers/2607.27888

发布于 7月30日

·

提交者 https://huggingface.co/qqiang

he (https://huggingface.co/qqiang) 于 8月3日

摘要

基于可验证奖励的强化学习(RLVR)是提升大语言模型长思维链(Long-CoT)推理能力的核心方法。无评论家方法(如 GRPO)将响应级奖励转换为优势值,并均匀地广播到所有 token 上,忽略了它们对最终结果的不平等贡献。相比之下,在策略自蒸馏(OPSD)通过最小化无特权策略与有特权自教师之间的前向 KL 散度来提供密集的分布级监督,其隐含假设是所产生的似然偏移编码了可靠的、与答案对齐的信息。我们通过固定每条采样轨迹并在两种对立的结果条件下重新评分来检验这一前提:一种条件断言正确,另一种断言错误。大多数受影响的 token 在两种条件下都沿相同方向偏移,几乎没有符号翻转,且所引发的优化信号存在大量重叠。大的偏移也集中在高度可替换的表层形式 token 上,而携带问题特定推理内容的 token 则不那么敏感。这些发现表明,特权偏移无法提供可靠的、与答案对齐的方向,而其幅度主要反映的是反事实敏感性,而非 token 级学习价值。基于这些观察,我们提出了反事实敏感性信用重新分配(CSCR),这是 GRPO 的一个简单扩展,它降低高敏感 token 的信用,并重新归一化 token 级优势值,以保留原始信用预算和验证器确定的方向。在长思维链数学推理基准上,CSCR 在相同数量的策略更新下持续优于 GRPO 基线。有针对性的消融研究进一步证实了我们的诊断:特权诱导的方向不可靠,适度的降权最有效,而更强的调制会破坏优化稳定性。

查看 arXiv 页面查看 PDF添加到收藏

在你的 agent 中获取这篇论文:

hf papers read 2607\.27888

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.27888,即可从本页面链接到它。

引用该论文的数据集 0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.27888,即可从本页面链接到它。

引用该论文的 Space 0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.27888,即可从本页面链接到它。

包含该论文的收藏集 0

暂无包含此论文的收藏集

将此论文添加到收藏集,即可从本页面链接到它。

相似文章

CoRT:用于令牌级评分导向策略优化的反事实重放

Hugging Face Daily Papers

CoRT 提出了一种针对 GRPO 的令牌级信用加权方法,利用反事实重放计算令牌级的对数似然对比,将带符号的优势值重新分配到各个令牌上,无需辅助评分器,与响应级 GRPO 相比平均提升 4.4 个百分点。

用于离散策略优化的引导对比Token信用分配

Hugging Face Daily Papers

本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。

通过反事实推理路径减少信用分配方差

arXiv cs.LG

提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。