梯度所知,结果未知:通过梯度对齐奖励解锁大语言模型推理的强化学习
摘要
本文介绍了梯度对齐奖励(GAR),一种通过与专家解决方案对齐梯度来增强大语言模型推理强化学习的方法,在数学和一般基准测试中显示出改进。
arXiv:2609.03342v1 Announce Type: new
摘要:基于可验证奖励的强化学习(RLVR)驱动大语言模型的思维链推理,但其二元结果奖励无法区分正确的轨迹。现有的密集奖励替代方案,从表面启发式方法到过程奖励模型,要么忽略了训练语料库中已存在的专家解决方案,要么需要昂贵的离线标注。我们提出梯度对齐奖励(GAR),它在策略自身的梯度空间中运行:通过输出投影层的截断反向传播为每次展开提取一个紧凑梯度向数,与专家锚定梯度的余弦相似度产生一个密集、推理感知的奖励,实际时间开销低于9%。我们证明这个余弦相似度可以分解为预测误差和激活模式因子的乘积,为对齐信号所衡量的内容提供了具体描述。在Qwen3-4B和Qwen3-8B上,GAR在竞赛级数学基准测试上持续优于GRPO和其他基线,并在无需领域特定数据的情况下转移到GPQA Diamond和MMLU-Pro。代码和数据可在https://github.com/LQgdwind/GAR获取。
查看缓存全文
缓存时间: 2026/09/04 06:25
# 梯度比结果更懂结果:通过梯度对齐奖励解锁大语言模型推理的强化学习 来源:https://arxiv.org/html/2609.03342 郑乐启 机构:清华大学 贡献:同等贡献 * 通讯作者:[email protected] 苏金波 机构:中国人民大学 贡献:同等贡献 * 通讯作者:[email protected] 牛方 机构:清华大学 贡献:同等贡献 * 通讯作者:[email protected] 王卫平 机构:中国科学院信息工程研究所 张佳俊 机构:中国科学技术大学 严善南 机构:清华大学 吴杰 机构:澳大利亚国立大学 康昭璐 机构:北京大学 付荣 机构:澳门大学 张航 机构:清华大学 ###### 摘要 基于可验证奖励的强化学习(RLVR)推动了大语言模型中的链式推理,然而其二元结果奖励无法区分不同的正确轨迹。现有的密集奖励替代方案,从表面启发式方法到过程奖励模型,要么忽略了训练语料库中已存在的专家解决方案,要么需要昂贵的离线标注。我们提出了梯度对齐奖励(GAR),该方法在策略自身的梯度空间中运行:通过输出投影层进行截断反向传播,为每次生成提取一个紧凑的梯度向量,然后与专家锚点梯度计算余弦相似度,从而生成密集、推理感知的奖励,且时钟开销不到9%。我们证明,这个余弦相似度可以分解为预测误差和激活模式两个因子的乘积,具体刻画了对齐信号所衡量的内容。在Qwen3-4B和Qwen3-8B模型上,GAR在竞赛级数学基准测试中始终优于GRPO及其他基线方法,并且无需领域特定数据即可迁移到GPQA Diamond和MMLU-Pro。代码和数据可在https://github.com/LQgdwind/GAR获取。 ## 1 引言 参见标题图1:GAR的梯度空间可视化。专家锚点向量vₐ(星号)在参数更新流形中定义了参考方向。正确生成(圆圈)通过与锚点的余弦相似度进行评分:高对齐度的生成(深色)获得较大的GAR奖励,而低对齐度的生成(浅色)尽管也是正确的,但获得较小的奖励。不正确的生成(叉号)被过滤掉,无论其梯度方向如何,奖励均为零。 基于可验证奖励的强化学习(RLVR)已成为激发大语言模型链式推理而不进行监督微调的一种引人注目的范式。在这一设定下,基础模型仅使用验证最终答案正确性的二元结果奖励进行优化,DeepSeek-R1-Zero证明了结构化推理可以从如此稀疏的监督中自发涌现。尽管取得了成功,但完全依赖二元奖励引入了一个基本的信用分配问题:一旦多个生成产生了正确答案,奖励信号在正确子集上就会变得平坦,由此产生的策略梯度不包含信息来优先强化更高质量的推理轨迹。这种缺陷促使我们寻找更密集、过程级的监督,然而现有的补救措施各有其显著局限性:(1) 专家解决方案未被使用。仅基于结果的RLVR为每个正确响应分配相同的奖励,将正确子集中的组相对优势降至零。广泛使用的数学语料库如NuminaMath-CoT已经随问题提供了专家链式推理解决方案,但现有的奖励机制都没有利用它们来提供过程级的训练信号。(2) 基于表面启发式的塑形。基于规则的奖励塑形方法引入长度或格式惩罚作为推理质量的替代指标,但这些启发式方法作用于表面属性,无法评估底层推理链是否真正涉及任务所需的推理结构。(3) 昂贵且离线的过程监督。过程奖励模型(PRM)提供步骤级反馈,但需要大规模的专家标注;即使是自动化的替代方案也是在固定分布上离线训练的,而该分布与不断演变的策略存在偏差。详细的比较见表1。 表1:奖励范式比较。GAR是唯一在梯度空间中利用专家CoT的方法。 这些局限性引出了一个自然的问题:我们能否将训练语料库已提供的专家解决方案转化为一种梯度空间信号,以区分不同的正确生成?我们发现可以,并提出了梯度对齐奖励(GAR),这是一种用于RLVR的轻量级在线过程奖励机制。其核心见解是:如果两个正确的轨迹实现了实质上相似的推理,那么它们通过输出投影层的梯度方向必然保持接近,无论表面文本变化如何。GAR通过仅对语言模型头进行截断反向传播,并通过与从训练语料库中现有链式推理解决方案派生的专家锚点梯度的余弦相似度来评分每次生成,从而实现了这一假设(图1)。该设计解决了所有三个局限性:与专家锚点的梯度余弦将易于获取的CoT解决方案转化为密集奖励;梯度信号捕捉了超出表面属性的推理级结构;在线、截断的计算消除了对步骤级标注或外部奖励模型的依赖。总之,我们的贡献有四点: (1) 基于专家锚点的梯度空间过程奖励。我们引入了一种奖励机制,将易于获取的专家链式推理解决方案转换为梯度空间参考向量,无需额外标注即可实现密集的、每次生成的过程监督。我们通过经验神经正切核和基于势的奖励塑形理论对该信号进行了理论支撑。 (2) 对齐信号的乘积分解。我们证明梯度余弦可以乘积分解为预测误差因子和激活模式因子(定理2),具体刻画了GAR区分正确轨迹的两个互补维度。 (3) 轻量级在线计算。通过输出投影层的截断反向传播将对齐成本降至O(V×d),为标准GRPO训练增加的时钟开销不到9%。 (4) 经验验证。在Qwen3-4B和8B基础模型上,GAR在四个竞赛级数学基准测试中持续带来pass@k的提升,并且无需领域特定训练数据即可迁移到GPQA Diamond和MMLU-Pro。 ## 2 方法 GAR的动机源于仅基于结果的强化学习的根本局限。在二元验证器奖励r(x,y)=1[Verify(x,y)]下,一个生成组内的所有正确响应都获得相同的奖励,因此GRPO的组相对优势在所有Kc个正确轨迹上坍缩为相同的值,无法优先强化更高质量的推理。随着训练进行且Kc→K,这进一步引发了策略更新的不稳定性。GAR通过引入与专家推理轨迹的梯度空间对齐,在正确响应中引入组内方差来解决这两种缺陷。端到端的流程概述见图2。 参见标题图2:一个GRPO步骤内的GAR流水线。(A) 策略生成K个生成;一个验证器过滤出正确响应(在标准GRPO下所有都获得r=1)。(B) 对于每个正确的生成,一个教师强迫前向传播产生隐藏状态H̃,这些状态在输出投影边界处被分离,并仅通过Wₒ进行反向传播以获取梯度激活向量vᵢ。专家CoT经历相同的过程(已缓存)以产生vₐ;它们的余弦相似度给出对齐奖励。(C) 梯度方向聚集在vₐ附近的生成获得更高的奖励,打破了平坦奖励的病理状态。 ### 2.1 梯度对齐假设 设L(θ;x,y)=−1/|y|∑ₜlog πθ(yₜ|x,y<t)为标准负对数似然。我们的关键观察是:对于两个正确的生成y和a,如果它们实现了相似的推理过程,那么它们通过输出投影层Wₒ的梯度方向应该相似。具体地,我们计算每个生成的梯度激活向量:vᵢ = normalize(gₒ(x,yᵢ)),其中gₒ(x,yᵢ) = ∇Wₒ L(Wₒ;x,yᵢ) ∈ ℝ^{|V|×d}是输出层梯度。对于专家锚点vₐ,我们从训练语料库中的专家解决方案计算其梯度激活向量。最终奖励定义为: r_GAR(x,yᵢ) = \begin{cases} r_{\text{base}} + \beta \cdot \max(0, \hat{b}(y_i)) + p(y_i), & r_{\text{raw}} > 0, \\ p(y_i), & \text{otherwise}, \end{cases} 其中\hat{b}(yᵢ) = b(yᵢ) - 1/|P(x)| ∑_{yⱼ∈P(x)} b(yⱼ)是在生成组的正确子集P(x)上居中的奖励,r_{\text{base}}(默认1.0)是正确性的基础奖励,β≥0(默认0.5)缩放对齐奖励,p(yᵢ)≤0是对违反规定思考/回答结构的响应施加的小格式惩罚。\max(0, \cdot)的裁剪确保在每个正确轨迹上,GAR奖励略高于仅基于结果的基线,这对于定理3中的安全奖励塑形保证至关重要。 ## 3 理论分析 所有证明均推迟到附录。 ### 3.1 NTK解释与乘积分解 设gₒ(x,y) = ∇Wₒ L(Wₒ;x,y) ∈ ℝ^{|V|×d}表示输出层梯度。简单的微分得出gₒ(x,y) = 1/|T_y| ∑ₜ (pₜ − e_{y_{t+1}}) ⊗ hₜ。 ###### 命题1(梯度激活乘积作为线性化对数似然) 设H_y ∈ ℝ^{n×d}表示来自无梯度前向传播的、在输出投影输入处的最终层隐藏状态矩阵。等式(3)中的每token信号uₜ = Gₜ ⊙ hₜ满足d/dη L((1+η)H_y)|_{η=0} = 1/|T_y| ∑ₜ 1ᵀ uₜ,因此聚合信号\bar{s}捕获了每个隐藏维度对数似然的线性化贡献。 ###### 定理1(NTK诱导的功能对齐) 设Θₒ(y,a) = ⟨vec(gₒ(x,y)), vec(gₒ(x,a))⟩表示输出层经验NTK,并设v_y, v_a表示等式(4)中的L2归一化梯度激活向量。在有界误差信号(\|̄δ_y\|₂ ≤ B_δ)和隐藏状态(\|̄h_y\|₂ ≤ B_h)下,存在常数c₁,c₂>0使得 c₁ cos(v_y, v_a) ≤ Θₒ(y,a)/(‖gₒ(x,y)‖_F ‖gₒ(x,a)‖_F) ≤ c₂ cos(v_y, v_a) + 𝒪(κ_y + κ_a), 其中κ_y, κ_a衡量每token误差在轨迹均值周围的分散度。定理1表明,奖励高余弦轨迹等价于奖励与专家锚点的高输出层NTK相似度,至多存在有界失真。 ###### 定理2(梯度对齐的乘积分解) 在相同假设下,NTK内积分解为: ⟨gₒ(x,y), gₒ(x,a)⟩ = (̄δ_yᵀ ̄δ_a) * (̄h_yᵀ ̄h_a) + 𝒪(B_h² κ_y κ_a + B_δ (κ_y + κ_a) B_h)。 乘积结构要求在预测误差分布和激活模式上均达成一致;通过不同计算路径达到正确答案的轨迹会得到较低的余弦分数。经验上,在六个训练集问题中,其中正确生成使用了可识别的不同解题方法,相同方法的生成获得的余弦分数比替代正确方法高3.5倍(平均b̄_same=0.45 vs. b̄_diff=0.13;附录M),证实该信号是基于底层推导策略进行区分的,而不是基于表面相关性如长度或格式。 ###### 推论1(子空间分离下的正交性) 如果ε有效支撑集S_ε^y和S_ε^a不相交,则|cos(v_y, v_a)| ≤ 2ε/d + 𝒪(κ_y + κ_a)。 ### 3.2 安全奖励塑形 ###### 定义1(经结果验证的最优策略) 策略π⋆是经结果验证最优的,如果它最大化𝒥₀(π) = E_{x,y∼π} 1[Verify(x,y)]。 ###### 定理3(GAR的安全性保证) 设π⋆是经结果验证最优策略,π为任意策略。在标准GRPO下,定义其优势估计为Â_{GRPO}(x,yᵢ) = r(x,yᵢ) − mean_{j} r(x,yⱼ)。对于GAR,定义Â_{GAR}(x,yᵢ) = r_{GAR}(x,yᵢ) − mean_{j} r_{GAR}(x,yⱼ)。则对于所有生成yᵢ,有: sign(Â_{GAR}(x,yᵢ)) = sign(Â_{GRPO}(x,yᵢ)), 即GAR优势估计与GRPO优势估计具有相同的符号,确保奖励塑形不会改变策略更新的方向。这保证了训练稳定性。
相似文章
GRAIL:面向可验证奖励强化学习的梯度重加权优势方法
GRAIL 引入了梯度重加权优势,以改进 LLM 推理强化学习中的 token 级信用分配,在多个模型上优于 GRPO。
RL用于LLM的价值梯度假说
本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。
GRPO 下基于梯度的 LoRA 秩分配:一项实证研究
本研究通过实证表明,在监督微调中有效的基于梯度的 LoRA 秩分配,在基于 GRPO 的强化学习中会导致性能下降,原因在于梯度景观更为平缓以及存在梯度放大效应。
不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化
本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。
超越推理:强化学习释放大型语言模型中的参数化知识
本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。