并非所有Token都值得同等信用:面向长CoT推理的反事实敏感性信用再分配
摘要
本文提出反事实敏感性信用再分配(CSCR),这是GRPO的一种简单扩展,可降低高敏感性Token的信用,并重新归一化Token级优势,用于长CoT数学推理。它持续优于GRPO基线,同时揭示特权Token移位方向不可靠,主要反映反事实敏感性而非学习价值。
查看缓存全文
缓存时间: 2026/08/03 13:32
论文页面 - 并非所有 Token 都值得同等信用:面向 Long-CoT 推理的反事实敏感性信用重新分配
Source: https://huggingface.co/papers/2607.27888
发布于 7月30日
·
提交者 https://huggingface.co/qqiang
he (https://huggingface.co/qqiang) 于 8月3日
摘要
基于可验证奖励的强化学习(RLVR)是提升大语言模型长思维链(Long-CoT)推理能力的核心方法。无评论家方法(如 GRPO)将响应级奖励转换为优势值,并均匀地广播到所有 token 上,忽略了它们对最终结果的不平等贡献。相比之下,在策略自蒸馏(OPSD)通过最小化无特权策略与有特权自教师之间的前向 KL 散度来提供密集的分布级监督,其隐含假设是所产生的似然偏移编码了可靠的、与答案对齐的信息。我们通过固定每条采样轨迹并在两种对立的结果条件下重新评分来检验这一前提:一种条件断言正确,另一种断言错误。大多数受影响的 token 在两种条件下都沿相同方向偏移,几乎没有符号翻转,且所引发的优化信号存在大量重叠。大的偏移也集中在高度可替换的表层形式 token 上,而携带问题特定推理内容的 token 则不那么敏感。这些发现表明,特权偏移无法提供可靠的、与答案对齐的方向,而其幅度主要反映的是反事实敏感性,而非 token 级学习价值。基于这些观察,我们提出了反事实敏感性信用重新分配(CSCR),这是 GRPO 的一个简单扩展,它降低高敏感 token 的信用,并重新归一化 token 级优势值,以保留原始信用预算和验证器确定的方向。在长思维链数学推理基准上,CSCR 在相同数量的策略更新下持续优于 GRPO 基线。有针对性的消融研究进一步证实了我们的诊断:特权诱导的方向不可靠,适度的降权最有效,而更强的调制会破坏优化稳定性。
在你的 agent 中获取这篇论文:
hf papers read 2607\.27888
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.27888,即可从本页面链接到它。
引用该论文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.27888,即可从本页面链接到它。
引用该论文的 Space 0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.27888,即可从本页面链接到它。
包含该论文的收藏集 0
暂无包含此论文的收藏集
将此论文添加到收藏集,即可从本页面链接到它。
相似文章
CoRT:用于令牌级评分导向策略优化的反事实重放
CoRT 提出了一种针对 GRPO 的令牌级信用加权方法,利用反事实重放计算令牌级的对数似然对比,将带符号的优势值重新分配到各个令牌上,无需辅助评分器,与响应级 GRPO 相比平均提升 4.4 个百分点。
用于离散策略优化的引导对比Token信用分配
本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。
通过反事实推理路径减少信用分配方差
提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。
ACPO:基于细粒度替代熵的自适应信用策略优化
介绍了ACPO,一种用于大型语言模型强化学习的token级信用分配框架,利用细粒度替代熵提升数学和编码基准的推理性能,优于DAPO、GTPO、SAPO等强基线。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。