当不可信令牌被强化:面向大语言模型强化学习的尾部感知信用校准

arXiv cs.CL 论文

摘要

提出尾部感知信用校准(TACO),通过校准统一信用分配以抑制对不可信尾部令牌的更新,解决大语言模型强化学习中的正向信用污染问题,提升训练稳定性和性能。

arXiv:2607.07976v1 公告类型:新摘要:强化学习(RL)在增强大语言模型(LLM)的推理能力方面取得了显著成功。然而,广泛使用的无评论家强化学习方法依赖于统一信用分配,将相同的优势赋予所有令牌,而不考虑其差异。我们发现了这种设计的一个关键失败模式,称为“正向信用污染”:低概率的尾部令牌(即上下文错误的令牌)与同一轨迹中合理的令牌获得相同的正向信用,导致有缺陷的推理行为被不加区分地强化。为缓解此问题,我们提出尾部感知信用校准(TACO),该方法校准统一信用分配以抑制不期望的正向更新。TACO首先计算一个尾部风险分数,该分数结合局部生成上下文,评估每个令牌落入不可信尾部的风险,区分意外稀有性与不确定性驱动的探索。然后TACO使用该分数为风险令牌调整正向信用,而不完全移除其梯度,从而反复出现的有用稀有模式可以累积强化,而偶然噪声逐渐减弱。在三个LLM和八个基准上的实验结果表明,TACO始终优于基于GRPO的基线。值得注意的是,TACO提升了训练稳定性,支持在长期RL中持续的性能提升。源代码可在 https://github.com/xiuyilou/TACO 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:11

# 尾部感知信用校准:面向LLM强化学习的令牌级校准机制 来源:https://arxiv.org/html/2607.07976

## 当不合理令牌被强化:面向LLM强化学习的尾部感知信用校准

Xiuyi Lou¹, Zicheng Xu¹¹¹footnotemark:1, Yu-Neng Chuang², Hoang Anh Duy Le², Zhaozhuo Xu³, Guanchu Wang⁴, Vladimir Braverman¹

¹约翰霍普金斯大学, ²莱斯大学, ³Workato, ⁴北卡罗来纳大学夏洛特分校

###### 摘要

强化学习(RL)在提升大型语言模型(LLM)推理能力方面取得了显著成功。然而,广泛使用的无评论家RL方法依赖于均匀的信用分配,即将相同的优势广播给所有令牌,而不考虑它们之间的差异。我们发现了这种设计的一个关键失效模式,称为**正信用污染**:低概率的尾部令牌(在上下文中是错误生成的)与同一轨迹中的合理令牌接收相同的正信用,导致有缺陷的推理行为被不加区分地强化。为了缓解这一问题,我们提出**尾部感知信用校准(TACO)**,一种校准均匀信用分配以抑制不良正更新的方法。TACO首先计算一个尾部风险得分,该得分结合了局部生成上下文,以评估每个令牌落入不可靠尾部的风险,从而区分意外罕见性与不确定性驱动的探索。TACO随后使用该得分为高风险令牌调整正信用,但不完全去除其梯度,这样重复出现的有用罕见模式可以累积强化,而偶然噪声则被逐步抑制。在三个LLM和八个基准上的实验结果表明,TACO持续优于GRPO风格基线。值得注意的是,TACO提升了训练稳定性,支持在长视界RL中持续获得性能提升。源代码已公开:https://github.com/xiuyilou/TACO。

## 1 引言

基于可验证奖励的强化学习(RLVR)已成为面向推理的LLM的一种常见后训练范式。最近的模型如OpenAI的o系列和DeepSeek-R1表明,大规模RL后训练可以显著提高自动可验证任务(包括数学和编程)的性能[14 (https://arxiv.org/html/2607.07976#bib.bib1), 2 (https://arxiv.org/html/2607.07976#bib.bib2)]。早期的RLVR方法通常基于近端策略优化(PPO),它依赖于学习的评论家进行优势估计[18 (https://arxiv.org/html/2607.07976#bib.bib3), 15 (https://arxiv.org/html/2607.07976#bib.bib4)]。相比之下,组相对策略优化(GRPO)用组相对优势取代了学习的评论家,降低了值建模开销,同时取得了强大的实证性能[19 (https://arxiv.org/html/2607.07976#bib.bib5)]。简单而有效的设计使GRPO成为推理RL的广泛采用骨干,催生了诸如解耦裁剪与动态采样策略优化(DAPO)和组序列策略优化(GSPO)等变体[34 (https://arxiv.org/html/2607.07976#bib.bib6), 38 (https://arxiv.org/html/2607.07976#bib.bib8)]。然而,这种简化计算了一个单一的完成级优势,并将其均匀广播给每个生成的令牌,尽管在获得奖励的完成中并非所有令牌都同样可靠。具体来说,来自策略分布低概率尾部的令牌(即在本生成上下文中不太可能的令牌)可以被采样到已获得奖励的完成中,即使它们在语义上不相关或存在错误;我们将这种局部不可靠的令牌称为不合理尾部令牌。然而,这些令牌的局部影响可能被整体正确的推理过程和最终答案绕过或忽视[22 (https://arxiv.org/html/2607.07976#bib.bib11), 10 (https://arxiv.org/html/2607.07976#bib.bib12), 6 (https://arxiv.org/html/2607.07976#bib.bib15)]。这些令牌随后与可靠令牌接收相同的正信用,导致既强化了良好的推理行为,也强化了局部有缺陷的延续。 Consequently, the accumulation of such updates throughout training progressively biases the policy away from well-calibrated reasoning patterns. We refer to this failure mode as **Positive-Credit Contamination**. 为了改进GRPO风格方法中的均匀信用分配,现有工作通常试图根据令牌对最终结果的估计重要性来区分令牌级更新。一类工作利用外部信号,如反事实分析、时间差分传播或执行反馈,来评估每个令牌的贡献并相应调整其信用[9 (https://arxiv.org/html/2607.07976#bib.bib20), 16 (https://arxiv.org/html/2607.07976#bib.bib9), 21 (https://arxiv.org/html/2607.07976#bib.bib10), 7 (https://arxiv.org/html/2607.07976#bib.bib21)]。另一类工作则利用内在信号,如令牌熵或分布散度作为每个令牌重要性的代理,将更新集中在被认为对推理过程关键的令牌上,而衰减常规令牌[20 (https://arxiv.org/html/2607.07976#bib.bib22), 12 (https://arxiv.org/html/2607.07976#bib.bib16), 35 (https://arxiv.org/html/2607.07976#bib.bib44), 26 (https://arxiv.org/html/2607.07976#bib.bib45)]。然而,现有方法存在两个基本局限性。首先,这些方法大多依赖额外的推理或辅助模型,引入了不可忽视的资源开销。其次,当前方法缺乏令牌可靠性的局部语义视角。不合理的尾部令牌可能出现在高贡献或高熵位置,现有方法将这些位置视为信息丰富,导致不可靠的信用被错误放大。 Together, these limitations restrict the effectiveness of existing credit-assignment methods in reasoning-oriented RL training. 为了克服这些局限性,我们引入了**尾部感知信用校准(TACO)**。与现有方法不同,TACO从局部语义视角校准均匀信用分配,以抑制不良的正更新,且仅增加微不足道的额外计算成本。具体来说,TACO估计每个令牌在其生成上下文中成为不合理尾部令牌的风险,对高风险令牌的正信用进行软抑制,同时保留对低风险令牌的完全强化。因此,TACO减少了对不可靠行为的有害正强化,同时保留了有用的探索。

参见说明图1:TACO在代表性基准和模型上持续优于GRPO。

实证方面,我们在三个LLM、六个数学推理基准以及两个分布外(OOD)科学推理基准上评估了TACO。TACO在所有设置下持续优于GRPO风格基线,图1 (https://arxiv.org/html/2607.07976#S1.F1) 突出了在五个代表性基准上的增益。我们的贡献可总结如下:

- **正信用污染**。我们发现了GRPO风格RLVR的一种失效模式,其中局部不合理的令牌接收正强化。
- **尾部感知信用校准**。我们引入了TACO,一种上下文感知方法,以可忽略的计算开销校准正令牌级信用。
- **综合评估**。TACO在多个基准上持续优于基线,在长视界训练下保持稳定性能。

## 2 相关工作

#### RLVR中的低概率令牌。
Recent research suggests that tokens exhibit heterogeneity, making uniform update rules in RLVR suboptimal, particularly for low-probability tokens [12 (https://arxiv.org/html/2607.07976#bib.bib16)]. On one hand, rare tokens sustain exploration by preserving diverse reasoning continuations and preventing premature policy collapse [5 (https://arxiv.org/html/2607.07976#bib.bib17)], motivating protective mechanisms such as clip-higher [34 (https://arxiv.org/html/2607.07976#bib.bib6)] and low-probability regularization [5 (https://arxiv.org/html/2607.07976#bib.bib17)]. On the other hand, rare tokens can destabilize optimization: their large gradient magnitudes can overshadow updates for high-probability tokens, and tokens with both low probability and low local entropy have been identified as primary drivers of training instability [33 (https://arxiv.org/html/2607.07976#bib.bib18), 11 (https://arxiv.org/html/2607.07976#bib.bib19)]. These findings motivated gradient-aware methods that dampen extreme token updates to enhance training robustness. Together, both directions highlight the importance of low-probability tokens in GRPO-style optimization, motivating further examination of their properties.

#### RLVR中的令牌级信用分配。
GRPO风格训练为完成中的每个令牌分配相同的轨迹级奖励,当令牌对最终结果的贡献不均时,可能导致信用分配错误。两个主要方向解决了这一局限性。第一个方向利用外部信号重新分配信用:OAR估计每令牌对结果的影响 [9 (https://arxiv.org/html/2607.07976#bib.bib20)];GRPO-λ\lambda通过时间差分方法向后传播信用 [16 (https://arxiv.org/html/2607.07976#bib.bib9)];TEMPO和EGCA利用响应结构和中间执行反馈将更新集中在关键决策点上 [21 (https://arxiv.org/html/2607.07976#bib.bib10), 7 (https://arxiv.org/html/2607.07976#bib.bib21)]。第二个方向基于内在信号重塑令牌级更新:GTPO/GRPO-S和HAPO使用不确定性度量(如令牌熵)作为重要性指标,使得高不确定性或探索性令牌优先于常规令牌得到处理 [20 (https://arxiv.org/html/2607.07976#bib.bib22), 12 (https://arxiv.org/html/2607.07976#bib.bib16)]。然而,这些方法主要建模贡献或重要性,而忽略了被授信令牌的上下文有效性。

## 3 预备知识

### 3.1 符号
令πθ\\pi_{\\theta}为自回归策略,词汇表为V\\mathcal{V}。对于提示qq和完成oi=(oi,1,...,oi,Ti)o_{i}=(o_{i,1},\\dots,o_{i,T_{i}}),我们记ci,t=(q,oi,<t)c_{i,t}=(q,o_{i,<t})为生成令牌oi,to_{i,t}时的上下文。每个令牌oi,to_{i,t}生成的概率为πθ(oi,t|ci,t)\\pi_{\\theta}(o_{i,t}|c_{i,t})。对于每组GG个完成,优势A^i=ri−mean({ri})std({ri})\\hat{A}_{i}=\\frac{r_{i}-\\mathrm{mean}(\\{r_{i}\\})}{\\mathrm{std}(\\{r_{i}\\})}对序列进行归一化。GRPO目标将相同的序列级优势A^i\\hat{A}_{i}广播给所有令牌。

### 3.2 问题表述:正信用污染
GRPO风格方法中的均匀信用分配可能在每个完成中强化局部不合理的产出。当低概率令牌(在上下文中可能性低)偶然出现在获得正奖励的完成中时,就会发生这种情况。由于策略将这些令牌视为正面的,类似于有效推理中的令牌,因此它们的概率会增加,导致对无效模式的强化。我们将这种现象称为**正信用污染**。在形式上,令b^i\\hat{b}_{i}为样本i的组归一化奖励。标准GRPO对所有令牌应用相同的更新:Δθ∝∑i∑tb^i∇θlogπθ(oi,t|ci,t)\\Delta\\theta\\propto\\sum_{i}\\sum_{t}\\hat{b}_{i}\\nabla_{\\theta}\\log\\pi_{\\theta}(o_{i,t}|c_{i,t})。因此,不合理令牌oi,to_{i,t}接收与可靠令牌相同的信用,导致对不可靠行为的强化。

## 4 TACO:尾部感知信用校准
我们提出TACO,一种基于局部上下文语义校准令牌级正信用的方法,旨在为正信用污染问题提供实用的解决方案。TACO的核心包括两个步骤:(1)尾部风险估计:计算令牌基于其生成上下文的尾部风险得分;(2)加权:使用该得分抑制高风险令牌的正信用。

### 4.1 令牌级尾部风险估计
在实践中,低概率本身并不完全区分意外罕见性和无效噪声。例如,探索行为(如尝试不同的解题方法)自然会产生低概率令牌,但这些令牌可能最终引导出正确结果。为了区分这两种情况,TACO结合了令牌的惊奇度及其周围上下文的局部熵。具体来说,我们为每个令牌oi,to_{i,t}定义局部惊奇度Si,t=−logπθ(oi,t|ci,t)\\mathcal{S}_{i,t}=-\\log\\pi_{\\theta}(o_{i,t}|c_{i,t})。然而,仅凭惊奇度会惩罚所有罕见事件,包括有用的探索。因此,我们引入局部熵作为上下文不确定性度量:Hi,t=H(πθ(·|ci,t))=−∑v∈Vπθ(v|ci,t)logπθ(v|ci,t)\\mathcal{H}_{i,t}=H(\\pi_{\\theta}(·|c_{i,t}))=-\\sum_{v\\in\\mathcal{V}}\\pi_{\\theta}(v|c_{i,t})\\log\\pi_{\\theta}(v|c_{i,t})。高局部熵表明上下文存在高度不确定性,此时低概率令牌可能是合理探索的一部分。低局部熵则表明上下文相对确定,此时低概率令牌更可能偏离任务推理。因此,我们按如下方式计算尾部风险得分:
ri,ttail=Si,t·exp(−αHi,t) (2)r^{\\mathrm{tail}}_{i,t}=\\mathcal{S}_{i,t}\\cdot\\exp(-\\alpha\\mathcal{H}_{i,t}) \\\\tag{2}
其中α>0\\alpha>0是一个控制局部熵抑制程度的超参数。高惊奇度与低局部熵的结合产生高尾部风险得分,表明令牌可能是不合理的尾部令牌。

### 4.2 尾部感知正信用加权
给定尾部风险得分ri,ttailr^{\\mathrm{tail}}_{i,t},我们将其转换为一个权重wi,tw_{i,t},该权重校准正信用:
wi,t={1−λ(1−exp(−ri,ttail)), ri,ttail>0, 1, ri,ttail≤0. (3)w_{i,t}=\\begin{cases} 1-\\lambda\\left(1-\\exp\\left(-r^{\\mathrm{tail}}_{i,t}\\right)\\right), & r^{\\mathrm{tail}}_{i,t}>0, \\\\ 1, & r^{\\mathrm{tail}}_{i,t}\\leq 0. \\end{cases} \\\\tag{3}
风险得分非正的令牌保持完整权重,而高风险令牌接收平滑衰减的权重,下限为1−λ1-\\lambda,其中λ∈(0,1)\\lambda\\in(0,1)是控制最大抑制强度的超参数。TACO随后将此权重应用于广播优势,以产生校准的令牌级优势:
A^i,tTACO=wi,tI[A^i>0]A^i. (4)\\hat{A}^{\\texttt{TACO}\\{\\}}_{i,t}=w_{i,t}^{\\mathbb{I}[\\hat{A}_{i}>0]}\\hat{A}_{i}. \\\\tag{4}
仅正优势被调制;负优势保持不变,以保留来自失败轨迹的抑制信号。

### 4.3 TACO算法
TACO集成到标准GRPO训练循环中,通过用等式(4 (https://arxiv.org/html/2607.07976#S4.E4))中的校准令牌级信用A^i,tTACO\\hat{A}^{\\texttt{TACO}\\{\\}}_{i,t}替换广播优势A^i\\hat{A}_{i}。GRPO代理的所有其他组件保持不变。由于TACO仅依赖前向传递中计算的令牌概率和熵,因此引入了可忽略的开销。算法1 (https://arxiv.org/html/2607.07976#alg1)总结了完整过程。

**算法1** TACO:尾部感知信用校准
1: 提示集D\\mathcal{D};策略πθ\\pi_{\\theta};验证器R\\mathcal{R};组大小GG;超参数α,λ\\alpha,\\lambda
2: **对于** 每个训练迭代 **执行**
3:    ## 标准GRPO rollout
4:    πθold←πθ\\pi_{\\theta_{\\mathrm{old}}}\\leftarrow\\pi_{\\theta}
5:    从D\\mathcal{D}中采样提示批次B\\mathcal{B}
6:    使用πθold\\pi_{\\theta_{\\mathrm{old}}}为每个提示生成GG个完成
7:    计算奖励和组归一化优势A^i\\hat{A}_{i}   ⊳\\triangleright 序列级信用
8:
9:    ## 尾部感知信用校准
10:   使用等式(2 (https://arxiv.org/html/2607.07976#S4.E2))通过局部惊奇度和熵估计令牌级尾部风险ri,ttailr^{\\mathrm{tail}}_{i,t}
11:   通过等式(3 (https://arxiv.org/html/2607.07976#S4.E3))将尾部风险转换为信用抑制权重wi,tw_{i,t}
12:   通过等式(4 (https://arxiv.org/html/2607.07976#S4.E4))将正序列级信用校准为令牌级优势A^i,tTACO\\hat{A}^{\\texttt{TACO}\\{\\}}_{i,t}
13:
14:   ## 标准GRPO策略更新
15:   使用A^i,tTACO\\hat{A}^{\\texttt{TACO}\\{\\}}_{i,t}通过GRPO裁剪代理更新πθ\\pi_{\\theta}   ⊳\\triangleright 令牌级信用
16:**结束对于**

## 5 实验
在本节中,我们进行实验以验证我们方法的有效性,旨在回答以下研究问题:
**RQ1:** TACO是否在多样化的推理基准上提升性能?
**RQ2:** TACO是否在更长的RL训练下保持性能增益,同时避免后期崩溃?
**RQ3:** TACO如何影响令牌级训练行为?

### 5.1 实验设置

#### 模型。
我们在来自不同模型家族和规模的两个LLM上评估TACO:Qwen3-1.7B-Base、Qwen3-4B-Base[30 (https://arxiv.org/html/2607.07976#bib.bib25)]和Qwen2.5-Math-7B[31 (https://arxiv.org/html/2607.07976#bib.bib34)]。对于主要实验,我们使用DAPO-Math-17K222https://huggingface.co/datasets/BytedTsinghua-SIA/DAPO-Math-17k作为训练数据集。我们的训练代码库基于verl[23 (https://arxiv.org/html/2607.07976#bib.bib24)],并遵循其标准GRPO训练配方。所有方法共享相同配置,方法特定超参数设置为其原始论文中报告的值。

#### 数据集。
我们在六个数学推理基准上评估训练好的模型:AIME 2024[36 (https://arxiv.org/html/2607.07976#bib.bib27)]、AIME 2025[37 (https://arxiv.org/html/2607.07976#bib.bib28)]、AMC 2023[13 (https://arxiv.org/html/2607.07976#bib.bib29)]、MATH-500[10 (https://arxiv.org/html/2607.07976#bib.bib12)]、Minerva Math[8 (https://arxiv.org/html/2607.07976#bib.bib30)]和OlympiadBench[3 (https://arxiv.org/html/2607.07976#bib.bib31)]。为了评估超越数学的分布外泛化能力,我们进一步在两个科学推理基准上评估:MMLU-Pro[24 (https://arxiv.org/html/2607.07976#bib.bib32)]和GPQA-Diamond[17 (https://arxiv.org/html/2607.07976#bib.bib33)]。我们报告AIME和AMC的avg@32,MATH-500、Minerva Math和OlympiadBench的avg@4,以及MMLU-Pro和GPQA-Diamond的avg@16。

#### 基线。
我们将TACO与三个基线进行比较。**GRPO**是标准的无评论家RLVR基线,我们使用clip-higher非对称裁剪实现以支持长期训练[19 (https://arxiv.org/html/2607.07976#bib.bib5), 34 (https://arxiv.org/html/2607.07976#bib.bib6)]。**GRPO w/ Adv. Reweighting**重新加权低概率令牌以减少其在策略梯度更新中的过度主导[33 (https://arxiv.org/html/2607.07976#bib.bib18)]。**STAPO**抑制来自具有过大梯度令牌的更新,以实现更稳定的优化[11 (https://arxiv.org/html/2607.07976#bib.bib19)]。更多细节见附录A (https://arxiv.org/html/2607.07976#A1)。

表1:在领域内数学推理基准和分布外科学推理基准上的主要结果。最佳结果用粗体标出。

相似文章

ARCA:令牌信号退化时的适配器残差信用分配

arXiv cs.LG

本文指出了在使用LoRA进行LLM强化学习时,令牌级信用分配中存在的一种结构性失效模式,即内在信号退化。它提出了适配器残差信用分配(ARCA),该方法从适配器的隐藏状态残差中推导令牌显著性,并与基线方法保持竞争力。

超越LLM强化学习中的统一令牌级信任区域

Hugging Face Daily Papers

本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。

Agentic RL: Token-In, Token-Out Done Right (16 minute read)

TLDR AI

This article explains the 'Token-In, Token-Out' (TITO) invariant in reinforcement learning for LLMs, highlighting a common error when training multi-turn agents with tool calls. It presents two solutions: using per-model renderers or designing training to avoid re-encoding decoded tokens, emphasizing prefix-preserving chat templates.

TACO:面向智能体工具使用的工具增强信用优化

Hugging Face Daily Papers

TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。