CoRT:用于令牌级评分导向策略优化的反事实重放
摘要
CoRT 提出了一种针对 GRPO 的令牌级信用加权方法,利用反事实重放计算令牌级的对数似然对比,将带符号的优势值重新分配到各个令牌上,无需辅助评分器,与响应级 GRPO 相比平均提升 4.4 个百分点。
查看缓存全文
缓存时间: 2026/07/30 05:46
论文页面 - CoRT:面向Token级评分标准的反事实重放策略优化
来源:https://huggingface.co/papers/2607.25659
发布于 7月28日
·
提交者:https://huggingface.co/jwhe
quinn (https://huggingface.co/jwhe) 于 7月30日
摘要
基于评分标准的强化学习通过针对明确标准评估模型输出,丰富了语言模型训练。然而在GRPO风格的流程中,这些结构化判断被简化为一个标量响应级奖励,并转换为一个响应级优势值,该优势值被均匀地广播到所有生成的token上。即使不同标准对应不同的文本跨度、格式选择或语义选择,这种方法也没有为响应内部的信用分配提供明确的机制。我们提出CoRT,一种用于评分条件化GRPO的token级信用加权方法。CoRT不需要训练辅助token评分模型,而是通过反事实重放,在同一采样响应上,分别使用原始的评分条件化提示和匹配的无标准提示进行重新评分。由此产生的token级对数似然对比值可作为对评分上下文依赖程度的代理。CoRT将这些对比值映射为有界的、响应归一化的权重,并用它们将带符号的GRPO优势值重新分配到各个token上,无需引入辅助评分器或改变响应级奖励。在指令微调模型和不同奖励粒度上的实验表明,在绝大多数比较中,CoRT优于对应的响应级GRPO,平均提升4.4个百分点。该方法与基于学习的token级信用基线相比仍具有竞争力,同时避免了单独的相关性学习阶段。这些结果表明,策略内部的反事实似然对比为响应内部的信用分配提供了有效的训练信号,同时保留了GRPO的简单性和稳定性。
查看arXiv页面 (https://arxiv.org/abs/2607.25659)
查看PDF (https://arxiv.org/pdf/2607.25659)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25659)
在你的Agent中获取这篇论文:
hf papers read 2607\.25659
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型与此论文关联
在模型 README.md 中引用 arxiv.org/abs/2607.25659 即可在此页面建立链接。
引用该论文的数据集0
没有数据集与此论文关联
在数据集 README.md 中引用 arxiv.org/abs/2607.25659 即可在此页面建立链接。
引用该论文的Space0
没有Space与此论文关联
在Space README.md 中引用 arxiv.org/abs/2607.25659 即可在此页面建立链接。
包含该论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可在此页面建立链接。
相似文章
用于离散策略优化的引导对比Token信用分配
本文提出引导对比策略优化(GCPO),这是一种新颖的算法,通过对比正负提示下的模型预测,在强化学习中实现每个Token的信用分配,在文本到图像生成和思维链推理基准测试中持续优于GRPO和DAPO基线。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。
CIGPO:用于多轮证据读取LLM智能体的上下文信息增益策略优化
本文识别出GRPO在多轮证据读取智能体中的奖励方差崩溃故障模式,并提出CIGPO方法,该方法使用每轮上下文信息增益奖励来维持梯度信号,在HotpotQA上实现了+105%的F1性能提升。
GRAIL:面向可验证奖励强化学习的梯度重加权优势方法
GRAIL 引入了梯度重加权优势,以改进 LLM 推理强化学习中的 token 级信用分配,在多个模型上优于 GRPO。