CoRT:用于令牌级评分导向策略优化的反事实重放

Hugging Face Daily Papers 论文

摘要

CoRT 提出了一种针对 GRPO 的令牌级信用加权方法,利用反事实重放计算令牌级的对数似然对比,将带符号的优势值重新分配到各个令牌上,无需辅助评分器,与响应级 GRPO 相比平均提升 4.4 个百分点。

基于评分标准的强化学习通过根据显式标准评估模型输出,丰富了语言模型的训练。然而,在 GRPO 风格的流水线中,这些结构化判断被简化为标量响应级奖励,并转化为响应级优势,均匀地广播到所有生成的令牌上。这就在响应内部缺乏明确的信用分配机制,即使不同的标准基于不同的跨度、格式决策或语义选择。我们提出 CoRT,一种用于基于评分标准条件的 GRPO 的令牌级信用加权方法。CoRT 不训练辅助令牌评分模型,而是利用反事实重放,在原始评分条件提示和匹配的无标准提示下重新评分同一采样响应。由此产生的令牌级对数似然对比作为对评分上下文依赖性的代理。CoRT 将这些对比映射到有界、响应归一化的权重,并用它们将带符号的 GRPO 优势重新分配到令牌上,而无需引入辅助评分器或改变响应级奖励。在指令调优模型和奖励粒度上的实验表明,CoRT 在绝大多数比较中优于匹配的响应级 GRPO,平均提升 4.4 个百分点。该方法与学习型令牌级信用基线保持竞争力,同时避免了单独的相关性学习阶段。这些结果表明,策略内部的反事实似然对比为响应内部信用分配提供了有效的训练信号,同时保持了 GRPO 的简单性和稳定性。
查看原文
查看缓存全文

缓存时间: 2026/07/30 05:46

论文页面 - CoRT:面向Token级评分标准的反事实重放策略优化

来源:https://huggingface.co/papers/2607.25659
发布于 7月28日

·

提交者:https://huggingface.co/jwhe

quinn (https://huggingface.co/jwhe) 于 7月30日

摘要

基于评分标准的强化学习通过针对明确标准评估模型输出,丰富了语言模型训练。然而在GRPO风格的流程中,这些结构化判断被简化为一个标量响应级奖励,并转换为一个响应级优势值,该优势值被均匀地广播到所有生成的token上。即使不同标准对应不同的文本跨度、格式选择或语义选择,这种方法也没有为响应内部的信用分配提供明确的机制。我们提出CoRT,一种用于评分条件化GRPO的token级信用加权方法。CoRT不需要训练辅助token评分模型,而是通过反事实重放,在同一采样响应上,分别使用原始的评分条件化提示和匹配的无标准提示进行重新评分。由此产生的token级对数似然对比值可作为对评分上下文依赖程度的代理。CoRT将这些对比值映射为有界的、响应归一化的权重,并用它们将带符号的GRPO优势值重新分配到各个token上,无需引入辅助评分器或改变响应级奖励。在指令微调模型和不同奖励粒度上的实验表明,在绝大多数比较中,CoRT优于对应的响应级GRPO,平均提升4.4个百分点。该方法与基于学习的token级信用基线相比仍具有竞争力,同时避免了单独的相关性学习阶段。这些结果表明,策略内部的反事实似然对比为响应内部的信用分配提供了有效的训练信号,同时保留了GRPO的简单性和稳定性。

查看arXiv页面 (https://arxiv.org/abs/2607.25659)
查看PDF (https://arxiv.org/pdf/2607.25659)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25659)

在你的Agent中获取这篇论文:

hf papers read 2607\.25659

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型与此论文关联

在模型 README.md 中引用 arxiv.org/abs/2607.25659 即可在此页面建立链接。

引用该论文的数据集0

没有数据集与此论文关联

在数据集 README.md 中引用 arxiv.org/abs/2607.25659 即可在此页面建立链接。

引用该论文的Space0

没有Space与此论文关联

在Space README.md 中引用 arxiv.org/abs/2607.25659 即可在此页面建立链接。

包含该论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可在此页面建立链接。

相似文章

用于离散策略优化的引导对比Token信用分配

Hugging Face Daily Papers

本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。