LambdaPO: 面向推理语言模型的Lambda风格策略优化
摘要
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
arXiv:2605.19416v1 Announce Type: new
摘要:组相对策略优化(GRPO)已成为现代强化学习对齐的基石,因其通过利用采样轨迹队列中的奖励归一化来避免显式价值批评器而备受推崇。然而,该方法依赖于单一的统计基线(如组均值),将轨迹空间的关联拓扑压缩为单个标量,从而抹去了在复杂、对排名敏感的奖励景观中导航所必需的细粒度偏好信息。为了解决这一问题,我们提出了一种新颖的框架——Lambda策略优化(LambdaPO),该框架通过将优势估计从标量值重新概念化为分解的成对偏好结构来解决这一信息理论瓶颈。具体来说,任何给定轨迹的优势被定义为与其队列中所有同伴的奖励差异的积分和,其中每个成对比较由策略自身对已建立偏好的概率置信度动态衰减。为了进一步缓解二元结果监督的稀疏性,我们通过添加语义密度奖励来增强目标,该奖励源自生成推理轨迹与真实解之间的精确率-召回率对齐。因此,我们的方法可以从一组 rollout 中挖掘更细粒度的优化信号,引导 LLM 达到更好的最优解。在具有挑战性的数学推理和问答任务上的实验结果表明,LambdaPO 相比基线方法取得了性能提升。
查看缓存全文
缓存时间: 2026/05/20 08:25
# LambdaPO:一种用于推理语言模型的Lambda风格策略优化
来源:https://arxiv.org/html/2605.19416
Zhe Yuan¹, Yipeng Zhou², Jinghan Li³, Xinyuan Chen⁴, Bowen Deng⁵, Zhiqian Chen⁴, Liang Zhao⁶
¹Pinterest, 旧金山, CA 94107, USA
²Facebook, 门洛帕克, CA 94025, USA
³密歇根大学安娜堡分校, 安娜堡, MI 48109, USA
⁴密西西比州立大学, 密西西比州, MS 39762, USA
⁵卡内基梅隆大学, 匹兹堡, PA 15213, USA
⁶埃默里大学, 亚特兰大, GA 30322, USA
(2026年3月11日)
###### 摘要
组相对策略优化 (Group Relative Policy Optimization, GRPO) 已成为现代强化学习对齐的基石,它通过利用对采样轨迹群组进行奖励归一化来避免显式的值评判器,从而备受推崇。然而,该方法依赖于单一的统计基线(如组均值),将轨迹空间的关系统计拓扑压缩为一个单一标量,从而抹去了在复杂、对排名敏感的奖励景观中导航所必需的细粒度偏好信息。为了解决这个问题,我们引入了一个新颖的框架——Lambda策略优化 (LambdaPO),它通过将优势估计从标量值重新概念化为一个分解的成对偏好结构,解决了这个信息论瓶颈。具体来说,任何给定轨迹的优势都被定义为与其群组中所有其他同伴的奖励差异的积分和,其中每个成对比较都由策略自身对已建立偏好的概率置信度动态衰减。为了进一步缓解二元结果监督的稀疏性问题,我们通过引入一个语义密度奖励来增强目标函数,该奖励源自生成推理轨迹与真实解之间的精确率-召回率对齐。因此,我们的方法能够从一组rollout中挖掘更细粒度的优化信号,引导LLM达到更优的极值。在具有挑战性的数学推理和问答任务上的实验结果表明,与基线方法相比,LambdaPO提升了性能。
## 1 引言
大型语言模型 (LLM) 的演进带来了用户期望的范式转变,从单纯的語言流畅性转向数学和复杂问答等领域的严谨推理能力。因此,强化学习 (RL) 已成为激励和放大这些认知行为的基础技术。虽然近端策略优化 (PPO) [[14]](https://arxiv.org/html/2605.19416#bib.bib1) 在早期人类偏好对齐中确立了事实上的标准,但其对辅助值网络的依赖带来了可扩展性挑战。为解决这一问题,近期的框架如直接偏好优化 (DPO) [[11]](https://arxiv.org/html/2605.19416#bib.bib18) 开创了基于参考的离线对齐方法,而 DeepSeekMath 和 DeepSeek-R1 则引入了组相对策略优化 (GRPO) [[15]](https://arxiv.org/html/2605.19416#bib.bib2),这是 PPO 的一种无评判器改进版本,显著提升了训练效率,同时保持了稳健的优化稳定性。此外,最近的进展如 SimPO [[9]](https://arxiv.org/html/2605.19416#bib.bib19) 和 ORPO [[6]](https://arxiv.org/html/2605.19416#bib.bib20) 通过消除对参考模型或显式奖励建模的需求,进一步简化了对齐流程,为 LambdaPO 旨在实现的效率树立了先例。
然而,GRPO 存在一个根本性的信息论瓶颈:它依赖一个单一的统计基线(组均值)进行优势估计。这种标量简化从根本上压缩了轨迹空间丰富的关系统计拓扑,从而抹去了在复杂、对排名敏感的奖励景观中导航所必需的细粒度成对偏好信号。通过将整个群组视为一个无差异的聚合体,现有方法导致了次优的信用分配和较高的梯度方差。为了克服这一限制,我们借鉴了学习排序 (Learning-to-Rank, LtR) 中建立的“虚拟梯度”原则,特别是 LambdaRank 框架 [[2]](https://arxiv.org/html/2605.19416#bib.bib4),提出了 Lambda 策略优化 (LambdaPO)。我们将优势函数重新概念化,不再简单地视为对群组均值的偏离,而是作为一种成对分解梯度。在这个新颖的框架中,特定轨迹的优势被定义为它相对于所有群组同伴的奖励差异的积分和,并由策略自身的概率置信度动态衰减。此外,我们通过引入语义密度奖励来解决严谨推理任务中奖励稀疏性的挑战——在这些任务中,二元结果监督无法正确奖励正确的中间逻辑。这种机制通过一个密集的、内容感知的信号来增强优化景观,该信号源自生成的思维链与真实解之间在词元级别的精确率和召回率对齐。这种方法有效地将 RL 与经典的列表式排序目标结合起来,使模型能够基于其内部信念与外部奖励结构之间的不一致性来自我退火学习率。我们在复杂的数学推理和具有挑战性的问答基准上验证了 LambdaPO。我们的结果表明,通过恢复标准组相对方法丢失的成对信息,LambdaPO 帮助轻量级 LLM 获得了更优越的推理性能。我们的贡献包括:
- • **方法论创新**:我们引入了 LambdaPO,这是一个利用成对优势分解来实现潜在偏好流形梯度的框架,解决了标量基线的关系统计瓶颈。
- • **密集信号增强**:我们提出了一种语义密度奖励机制,通过明确奖励对真实推理词元的召回率和生成推理过程的精确率,来缓解基于结果监督的稀疏性问题。
- • **实证性能**:我们通过在数学推理和具有挑战性的问答基准上进行的大量实验证明,LambdaPO 显著优于 GRPO,为无评判器对齐建立了新的最先进水平。
## 2 相关工作
**LLM 推理研究**:许多工作致力于提升 LLM 的推理能力。它们可以分为三个方向:(1) 显式推理轨迹,(2) 工具增强,以及 (3) 基于强化学习的优化。思维链 (Chain-of-Thought, CoT) [[18]](https://arxiv.org/html/2605.19416#bib.bib5) 首先证明,提供逐步推理过程能使模型在算术、逻辑和常识任务上达到比直接回答提示更好的泛化效果。当小模型在由大教师模型生成的高质量思维链推理过程上进行显式训练时,它们可以获取强大的推理技能。这导致了自我改进范式,如 STaR [[23]](https://arxiv.org/html/2605.19416#bib.bib21),它利用自我生成的推理过程来引导推理能力。为了进一步完善这些轨迹,诸如 Math-Shepherd [[17]](https://arxiv.org/html/2605.19416#bib.bib22) 之类的方法利用自动化的过程级监督来将信用分配给单个推理步骤,解决了 LambdaPO 试图通过其成对分解来解决的信用分配问题。另一个工作领域侧重于将 LLM 与外部工具集成,以提高数值精度和程序推理能力。ReAct [[21]](https://arxiv.org/html/2605.19416#bib.bib6) 引入了一个统一框架,将自然语言推理与工具动作(例如,搜索、计算器、代码执行)交错进行,使 LLM 能够迭代思考和反思。Toolformer [[13]](https://arxiv.org/html/2605.19416#bib.bib7) 进一步表明,LLM 可以自我监督工具使用的示例,使得模型能够自主决定何时以及如何调用工具。这些工作共同表明,通过外部工具或环境增强 LLM 可以带来更可靠和可解释的推理。
**从 GRPO 到 DAPO**:虽然最近像 OpenAI 的 o1 和 DeepSeek 的 R1 这样的推理 LLM 通过测试时扩展和强化学习 (RL) 展示了令人印象深刻的性能,但训练流程背后的完整算法细节在很大程度上仍未公开。这些方法的演进处于一个更广泛的理论努力中,旨在改进策略梯度,例如 KTO [[4]](https://arxiv.org/html/2605.19416#bib.bib23),它通过前景理论的视角来构建对齐。DAPO(解耦裁剪和动态采样策略优化)[[22]](https://arxiv.org/html/2605.19416#bib.bib14) 明确强调了这种可复现性差距:当他们在一个 Qwen2.5-32B 模型 [[20]](https://arxiv.org/html/2605.19416#bib.bib15) 上运行一个朴素的 GRPO 基线时,仅在 AIME 基准上获得了 30 分——远低于 DeepSeek-R1 的 47 分。这一性能差距推动了 DAPO 核心技术的设计,并且作者不仅开源了算法,还开源了他们的训练代码和数据,以实现可复现性。
## 3 预备知识
### 3.1 语言模型作为随机策略
我们将文本生成任务框架化为一个序列决策问题。一个 LLM 被视为一个随机策略,记为 π_θ,由权重 θ 参数化。对于每个提示 q,策略生成一个词元序列 o = (y_1, y_2, ..., y_T)。那么整个序列的概率是条件词元概率的乘积:π_θ(o|q) = ∏_{t=1}^T π_θ(y_t | q, y_{<t})。
### 3.2 组相对策略优化 (GRPO)
GRPO 通过使用从当前策略 π_θ 采样的轨迹群组计算的优势 A_i 来修改标准策略梯度。对于给定提示 q,我们采样 G 个独立轨迹 {o_1, ..., o_G},并根据奖励函数 R 评估每个轨迹以获得奖励 {R_1, ..., R_G}。在 GRPO 的流行变体中 \[5, 15\],优势 A_i 计算为 A_i = (R_i - mean(R)) / std(R)。GRPO 的目标函数为:
L_GRPO(θ) = E[ (1/G) ∑_{i=1}^G ( min( r_i(θ) A_i, clip(r_i(θ), 1-ε, 1+ε) A_i ) - β D_KL(π_θ || π_ref) ) ]
其中 r_i(θ) = π_θ(o_i|q) / π_{θ_old}(o_i|q) 是重要性采样比率,clip 操作将其限制在 [1-ε, 1+ε] 内,而 KL 散度项惩罚策略的剧烈偏移。
## 4 方法:Lambda 策略优化 (LambdaPO)
### 4.1 动机:GRPO 中的关系瓶颈
GRPO 依赖一个关键的简化:它通过对所有优势求和 G 来聚合群组信息,从而产生一个单一标量。这个操作在相邻的采样轨迹之间产生了严重的熵——它无法区分一个轨迹是“唯一正确的”还是“稍微比其他好一点”。我们将这种信息的丢失称为关系瓶颈。
### 4.2 LambdaPO:偏好感知优势
LambdaPO 将优势估计从根本上从标量重新概念化为一个成对分解结构。对于给定的轨迹 i 及其对应的奖励 R_i,我们定义 Lambda 优势为:Λ_i = ∑_{j=1, j≠i}^G (R_i - R_j) · σ( (R_i - R_j)/τ )
其中 σ(·) 是 sigmoid 函数,τ > 0 是一个温度超参数,控制排序的“软实度”。这个公式赋予每个优势估计以成对的、群体感知的视角:Λ_i 不仅是轨迹 i 自身的积累,而是对奖励系统中固有排序结构的显式编码。
### 4.3 语义密度奖励
为了进一步缓解奖励稀疏性——这是正确/错误二元目标的一个特征——我们引入了语义密度奖励 R_sem。其核心思想是增加一个细粒度的信号,根据生成推理过程与参考解之间对齐的精确率和召回率来提供中间反馈。
- **精确率度量**:对于生成输出 o 中的每个推理步骤 S_k,我们计算一个精确率分数,通过衡量 o 中的推理词元被参考完成 r 中某个匹配位置覆盖的比例来实现。精确率得分定义为 P_k = 匹配词元数 / 生成词元数。
- **召回率度量**:我们计算生成的轨迹 o 覆盖参考解 r 中真实推理词元的比例。召回率得分为 R_k = 匹配词元数 / 参考词元数。
然后,生成的序列 o 的语义密度奖励被定义为跨所有标记步骤的平均 F1 分数:R_sem(o) = (1/T) ∑_{t=1}^T F1_t,其中 F1_t = 2 · (P_t · R_t) / (P_t + R_t) + δ,δ 是一个小常数以防止除零。
经验上,我们使用简单的最小-最大对齐策略来避免对词元级解析器的需求:令 token_match(o, r) 为从生成轨迹 o 到参考解 r 的精确率-召回率对齐,由外部奖励模型结合位置权重计算得出。在我们的实现中,R_sem 被直接集成到最终奖励函数中:R_total(o) = R_acc(o) + λ R_fmt(o) + β R_sem(o),其中 λ 和 β 是权重超参数。
### 4.4 梯度分析
为了直观理解,我们检查当 τ → 0⁺ 时的极限情况(硬排序)。在这种情况下,sigmoid σ(x/τ) 逼近单位阶跃函数。然而,有限温度 τ 会产生值得关注的三种情况:
- **情况 I(偏好一致)**:当 R_i > R_j 时,梯度信号将 i 推离 j,促进了顺序结构。
- **情况 II(偏好冲突)**:当奖励顺序与策略置信度不一致时(例如,R_i > R_j 但 s_i < s_j),sigmoid 项趋于 0,但相对于对数几率(源自隐式目标)的梯度会产生一个强校正信号(类似于 LambdaRank 机制)。
- **情况 III(收敛)**:当策略与奖励对齐时(对于 R_i > R_j 有 s_i ≫ s_j),梯度贡献自然衰减,防止对已建立模式的过度优化,并将容量集中在未解决的区别上。
温度 τ 进一步调节这种动态,作为一个谱正则化项,防止训练早期阶段的梯度饱和。
### 4.5 LambdaPO 算法
完整的训练过程将成对分解优势集成到 PPO 裁剪机制中。该算法保留了 GRPO 的无评判器效率,同时最大化从每个采样群组中提取的信息。
## 5 实验
### 5.1 实验设置
#### 5.1.1 数据集
我们重点评估数学推理能力,这是一个以严格逻辑依赖和二元奖励信号(正确/错误)为特征的领域。
- • **RL 训练阶段**:我们使用 OpenR1-Math-220k 和 GSM8K [[3]](https://arxiv.org/html/2605.19416#bib.bib8) 构建训练语料。这种组合提供了不同难度的题目,从小学算术到竞赛级数学。对于每个训练提示,奖励基于准确性和格式进行计算。
- • **评估基准**:我们报告在三个渐进困难的基准上的性能:AIME24 [[24]](https://arxiv.org/html/2605.19416#bib.bib9)、MATH-500 [[7]](https://arxiv.org/html/2605.19416#bib.bib11) 和 GPQA-Diamond [[12]](https://arxiv.org/html/2605.19416#bib.bib10)。
#### 5.1.2 配置
- • **基线**:我们主要将 LambdaPO 与组相对策略优化 (GRPO) 进行比较。由于 LambdaPO 被设计为 GRPO 优势估计模块的直接即插即用替代品,这种比较严格地隔离了成对分解机制的贡献。
- • **模型**:我们评估在不同架构和规模上的方法,以评估泛化能力。具体来说,我们使用 Qwen3 系列 [[19]](https://arxiv.org/html/2605.19416#bib.bib16)(1.7B 和 4B 参数)和 Phi-4-mini [[1]](https://arxiv.org/html/2605.19416#bib.bib17)(4B)。
- • **采样配置**:我们采用群组大小 G=8。
- • **奖励函数**:我们使用复合奖励函数 R(o) = R_acc + λ R_fmt + β R_sem。其中 R_acc 是二元正确性奖励,R_fmt 是格式合规奖励,惩罚结构偏差,R_sem 是语义密度奖励。
- • **LambdaPO 设置**:除非另有说明,根据我们的消融研究,我们将温度参数设置为 τ=1.0。
表 1:模型在基准上的性能比较
### 5.2 实验结果
表 1 (https://arxiv.org/html/2605.19416#S5.T1) 展示了 LambdaPO 与 GRPO 基线在两种不同模型架构(Qwen3 和 Phi-4-mini)上的对比性能。
**性能优越性**。LambdaPO 在所有评估任务上始终优于 GRPO。在 Qwen3-4B 模型上,我们的方法实现了 76.49% 的平均准确率,比基线提升了 +1.45%。这表明成对比较对于区分高质量推理路径至关重要的困难推理任务特别有效。
**架构泛化性**。改进并非特定于单一架构。在 Phi-4-mini 上,LambdaPO 实现了平均 +1.86% 的提升(55.35% → 56.38%)。这些改进在不同模型族上的稳健性验证了“关系瓶颈”假设的普遍性以及我们解决方案的有效性。
### 5.3 消融研究与分析
**参数敏感性 (τ)**。式 (4) 中的温度参数 τ 控制 sigmoid 加权函数的灵敏度,有效地决定了成对排序的“软实度”。我们使用 Qwen3-1.7B 模型在 τ ∈ {1, 1.5, 2, 5, 7} 范围内进行了扫描。
- • **低温度 (τ=1)**:梯度信号变得过于确定,导致优化不稳定。性能 (58.80%) 优于基线但并非最优。
- • **高温度 (τ=7)**:排序结构几乎均匀,近似于点估计,减少了成对分解的优势。相似文章
GraphPO:面向推理模型的基于图策略优化
GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
SocraticPO:通过交互式指导的策略优化
SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。
超越轨迹模仿:面向大模型推理的Strategy-Guided Policy Optimization
介绍了针对大模型推理的Strategy-Guided Policy Optimization(SGPO),该方法用策略蒸馏替代轨迹模仿,提升了数学基准测试上的泛化能力。
GenPO++: 生成式策略优化与无雅可比似然比
GenPO++ 提出了一种可逆生成式策略优化框架,该框架在高阶可逆 ODE 求解器中使用历史状态作为辅助记忆,从而为强化学习中的流式策略实现精确反演和无雅可比似然比计算。它在大规模控制、微调和真实世界机器人任务上取得了有竞争力的性能,同时提高了稳定性和效率。