超越模式崩溃:面向多样化推理的分布匹配
摘要
本文识别了同策略强化学习方法(如GRPO)中的模式崩溃问题,并提出了DMPO,该方法通过近似前向KL散度最小化来保持解的多样性。在NP难组合优化和数学推理任务上取得了显著改进。
查看缓存全文
缓存时间: 2026/05/20 08:29
# 超越模式坍缩:面向多样推理的分布匹配 来源:https://arxiv.org/html/2605.19461 杨立 独立研究员 辛宇 上海人工智能实验室,中国 浙江大学,中国 丁慎远 上海人工智能实验室,中国 复旦大学,中国 李沛吉 上海人工智能实验室,中国 复旦大学,中国 陈永康 上海人工智能实验室,中国 马一川 上海人工智能实验室,中国 复旦大学,中国 吕天义 同济大学,中国 李林阳 上海人工智能实验室,中国 复旦大学,中国 香港中文大学,中国 林达华 上海人工智能实验室,中国 香港中文大学,中国 郭启鹏† 上海人工智能实验室,中国 复旦大学,中国 刘庆文† 同济大学,中国 陈凯 上海人工智能实验室,中国 ###### 摘要 基于在线策略的强化学习方法(如 GRPO)饱受*模式坍缩*之苦:它们展现出降低的解法多样性,一旦发现某个单一解法便集中概率质量,并停止探索替代策略。我们表明,这源于反向 KL 最小化的模式寻求行为,该行为强化了第一个发现的高奖励轨迹,而不是在多个不同的优质解法上维持一个分布。我们提出 DMPO(Distribution-Matching Policy Optimization,分布匹配策略优化),通过对正向 KL 最小化进行原则性近似来防止模式坍缩。DMPO 在组级别构建一个与采样轨迹奖励成比例的目标分布,然后将策略分布与此目标对齐。这提供了模式覆盖行为,而无需从难以处理的全局目标分布中采样,从而在整个训练过程中实现持续的探索。我们在 NP-难组合优化问题上验证了 DMPO,这类问题存在指数级多的可行解,但只有少数接近最优——这是评估探索的理想测试平台。在基于文本的 NP-Bench 上,DMPO 达到了 43.9% 的质量比率(GRPO 为 40.1%),而在基于视觉的 NP-Bench 上达到了 43.1%(GRPO 为 38.4%),分别相对提升了 9% 和 12%。这些增益泛化到了数学推理(`+2.0%`)和域外任务(`+2.3%`),表明保留多样性的训练能增强跨模态的通用推理能力。我们的工作将分布匹配确立为一种实用且原则性的方法,用于防止在线策略 RL 中的模式坍缩,并在多样的推理任务上通过持续探索展现出一致的质量提升。 †††通讯作者:郭启鹏 ([email protected]),刘庆文 ([email protected])††代码地址:https://github.com/OliverLeeXZ/DMPO## 1 引言 基于可验证奖励的强化学习(RLVR)已成为训练大型推理模型(LRM)的强大范式,在数学问题求解 [he2025deepmath, yu2025dapo] 和代码生成 [liu2025code] 方面取得了显著进展。通过学习奖励模型替换为精确的、基于规则的验证,RLVR 能够实现稳定的优化和可扩展的改进。因此,如 GRPO [shao2024deepseekmath] 等在线策略方法已成为训练面向推理的语言模型的标准工具。尽管取得了成功,这些方法却面临一个随着训练进程加剧的根本性局限:*模式坍缩* [karan2025reasoning, yue2025does, song2025outcome]。一旦发现一个单一的高奖励解,策略会迅速将概率质量集中到该轨迹上,抑制了替代求解策略,并实质上中止了探索。这种过早收敛阻碍了更优解的发现,降低了鲁棒性,并导致无法泛化的脆弱推理行为。我们证明,这种现象并非实现上的瑕疵,而是标准在线策略 RL 优化目标的直接后果。GRPO 及相关方法隐式地最小化了策略与奖励加权分布之间的*反向*KL 散度。虽然反向 KL 在精炼已知的优良模式上很有效,但它本质上是*模式寻求*的:它放大了遇到的第一个成功轨迹,而不是在多个不同的高奖励解上维持一个分布。相比之下,正向 KL 最小化展现出*模式覆盖*行为,鼓励策略匹配目标分布的完整支撑集 [murphy2012machine]。尽管先前的工作已从经验上观察到训练中多样性的下降 [yue2025does, song2025outcome, chen2025pass],但反向 KL 作为 RLVR 中模式坍缩的根本原因尚未被系统性地解决。受此分析启发,我们提出了*分布匹配策略优化*(DMPO),一种通过近似正向 KL 最小化来缓解模式坍缩的原则性在线策略算法。直接优化正向 KL 是难以处理的,因为它需要从全局奖励加权分布中采样轨迹。DMPO 通过在*组级别*操作规避了这一挑战:对于每组采样的轨迹,我们构建一个与它们奖励成比例的目标分布(玻尔兹曼分布),并显式地将策略分布与此目标对齐。该公式自然地兼容 GRPO 的基于组的优势归一化,并且可以通过在标准目标中添加一个单一的分布匹配正则化项来实现。因此,DMPO 保留了多个高奖励模式,并在整个训练过程中维持探索。为了严格评估探索行为,我们需要任务具备多个高质量解,模式坍缩易于观察,并且解的质量可以精确测量。NP-难组合优化满足所有三个标准。这类问题存在指数级多的可行解,但只有一小部分接近最优,使其成为研究探索与利用之间权衡的理想测试平台。基于 NP-Bench [npengine],我们引入了 MM-NP-Bench,一个多模态基准,包含 10 个基于文本和视觉的组合优化任务,涵盖路由、覆盖、划分、子结构和约束。每个任务都包含带可控难度的参数化生成器、精确的基于规则的验证器,以及提供近最优基线的启发式求解器,从而能够通过我们提出的质量比率指标精确评估解的质量。在纯文本和多模态基准上,DMPO 均持续优于 GRPO 及其变体。在 NP-Bench 上,DMPO 达到了 43.9% 的质量比率,而 GRPO 为 40.1%,相对提升 9%。在 MM-NP-Bench 上,DMPO 达到了 43.1% 对比 38.4%,相对提升 12%。这些增益表明,分布匹配有效地防止了过早收敛,使得能够发现模式寻求目标无法找到的更高质量解。此外,收益超越了组合优化:DMPO 在数学推理上提升了 2.0%,在域外任务上提升了 2.3%,表明保留多样性的训练能产生更鲁棒和可迁移的推理能力。总之,我们的贡献有三点: - • 识别并解决模式坍缩:我们展示了在线策略 RL 方法由于反向 KL 的模式寻求行为而遭受模式坍缩,并提出了 DMPO——一种简单、实用的解决方案,在组级别近似正向 KL 最小化,在优化任务上实现了 9-12% 的相对提升。 - • MM-NP-Bench:一个用于测试探索的多模态基准:我们引入了 MM-NP-Bench,将 NP-Bench [npengine] 扩展到视觉-语言模型,包含 10 个 NP-难任务的视觉表示。该基准配备了双指标评估(成功率与质量比率),使得模式坍缩可被观察:高 SR 但低 QR 表明策略找到了解但未优化解。我们提供了完整的基础设施,包括参数化生成器、基于规则的验证器和启发式求解器,支持评估和 RLVR 训练。 - • 实证验证与迁移学习:大量实验表明,DMPO 在优化任务上以 4.7%-3.8% 的优势优于五个强基线,在数学推理上提升 2%,在域外任务上提升 2.3%,有证据表明保留多样性的训练能迁移到通用推理能力。 ## 2 相关工作 强化学习中的模式坍缩 模式坍缩——策略倾向于集中到单一解——是强化学习中一个被充分记录的现象。它与反向 KL 散度的模式寻求行为之间的关联已在文献中确立:murphy2012machine 表明最小化 DKL(q∥p) 会使 q 集中在 p 的单一模式上,而 levine2018reinforcement 在最大熵 RL 的背景下明确讨论了这一点。然而,尽管有这种理论理解,模式坍缩在实践中仍然普遍存在。ahmed2019understanding 记录了策略优化过程中熵的下降,指出标准 RL 方法收敛到近乎确定性的策略。eysenbach2021maximum 表明,在多模态奖励景观中,仅靠熵正则化不足以防止坍缩。在语言模型训练中,yue2025does 和 song2025outcome 观察到,RLVR 方法相比基模降低了解法多样性。虽然反向 KL 与模式寻求之间的理论联系是已知的,但*实用的解决方案仍然难以捉摸*。正向 KL 最小化 DKL(p∥q) 会提供模式覆盖行为,但需要从目标分布 p 中采样,而这是难以处理的。 策略优化中的多样性 已有几种方法被提议用于在 RL 中维持多样性。熵正则化 [haarnoja2018soft, ahmed2019understanding] 为奖励添加熵奖励,但 eysenbach2021maximum 表明,当策略对次优解变得自信时,这不足以防止模式坍缩。内在动机 [pathak2017curiosity, burda2018exploration] 通过基于预测误差或状态访问计数的探索奖励来增强奖励,鼓励策略访问新状态,但这些方法侧重于状态空间覆盖而非解法多样性,并且可能被无关的新颖性分散注意力。集成方法 [elliott2021wisdom, zhumabekov2023ensembling] 使用不同初始化训练多个策略,维持集成间的多样性,但随着集成规模的扩大扩展性差,并且缺乏单个策略多样性的理论保证。最近在 LLM 训练中的工作从不同角度探索了多样性。RLEntropy、ClipCov、wang2025beyond 约束高协方差 token 上的更新,以在训练期间保持随机性。chen2025pass 显式优化 pass@k 指标作为奖励,鼓励模型生成多样化的响应,其中至少一个成功。zhuang2025exploring, an2025polaris 提出了自适应温度策略,根据不同提示或训练阶段改变采样温度,以平衡探索与利用。FlowRL [flowrl] 提出了 FlowRL,通过学习全局配分函数来构建玻尔兹曼目标分布,应用了 GFlowNet 原理。然而,由于从目标分布采样难以处理,FlowRL 仍然最小化反向 KL DKL(πθ∥p∗),因此仍然容易受到模式寻求行为的影响。我们的工作不同之处在于,我们在组级别近似正向 KL 最小化 DKL(p∗∥πθ)——这是一个易于处理的近似,无需全局采样或学习到的配分函数即可提供模式覆盖行为。这种方法与 GRPO 的基于组优势归一化无缝集成,并展现出持续改进。 用于语言模型推理的 RLVR 基于可验证奖励的强化学习(RLVR)已成为训练推理模型的主导范式 [2025RLsurvey, guo2025deepseek, o1]。在线策略方法因其稳定性和样本效率而尤为流行。PPO [ppo] 使用裁剪的重要性比率来约束更新。GRPO [grpo] 使用基于组的优势归一化扩展了 PPO,提高了语言模型的稳定性。GSPO [gspo] 进一步通过引导搜索对其进行了改进。GPG [gpg] 结合了带有广义优势估计的策略梯度。然而,所有这些方法都最小化反向 KL 散度,使它们容易受到模式坍缩的影响。我们的工作表明,一个简单的修改——添加一个分布匹配项——可以在保持在线策略训练的稳定性和效率的同时防止这种坍缩。DMPO 无缝扩展了 GRPO 的基于组公式,使其适用于大规模语言模型训练。 参见图注 图 1: DMPO 概览。 该框架生成一组轨迹 {Oi} 来计算优势 A 和概率 π。而标准 GRPO(底部的流程)专注于奖励最大化,我们新颖的分布匹配模块通过 MSE 显式地将策略的经验分布与奖励诱导的目标分布对齐。这种双目标机制缓解了在线策略 RL 中常见的模式坍缩,并保留了对于解决复杂推理问题至关重要的推理多样性。 ## 3 分布匹配策略优化 我们提出 DMPO,它通过在组级别近似正向 KL 来缓解模式坍缩。我们首先展示标准在线策略 RL 最小化反向 KL,这导致了模式寻求和过早收敛,然后推导出 DMPO 作为一种实用解决方案,通过组级分布匹配提供模式覆盖行为。 ### 3.1 预备知识:在线策略 RL 与模式坍缩 组相对策略优化(GRPO)。考虑一个策略 πθ 和参考策略 πref。给定查询 x,我们从当前策略 πθ_old 中采样 G 条轨迹 O={o1,...,oG}。GRPO [grpo] 使用带有组归一化优势的裁剪替代目标来优化策略。对于轨迹 oi,目标为: Ji(θ)=min(ρi(θ)A^i, clip(ρi(θ),1-ε,1+ε)A^i), (1) 其中 ρi(θ)=πθ(oi|x)/πθ_old(oi|x) 是重要性比率,A^i 是组归一化优势(组内奖励的 z 分数): A^i=(r(oi)-mean({rj}))/(std({rj})+ε)。 完整的 GRPO 目标为: L_GRPO(θ)=-(1/G)∑_{i=1}^G Ji(θ)+β_KL DKL(πθ∥πref), (2) 其中 β_KL 是一个超参数,控制到参考策略的 KL 惩罚强度,防止策略过度偏离 πref 以保证训练稳定性。 策略梯度作为反向 KL 最小化。为了理解模式坍缩为何发生,我们建立了策略梯度方法与反向 KL 散度之间的联系。在最大熵 RL [ziebart2008maximum, levine2018reinforcement] 中,目标是最大化期望奖励加上熵: max_θ E_{τ~πθ}[r(τ
相似文章
提示引导的多样化策略优化用于LLM推理
本文介绍了提示引导的多样化策略优化(HDPO),这是一个两阶段强化学习框架,鼓励LLMs首先生成多个候选解决方案大纲(提示),然后选择最可靠的一个进行详细推理,从而提升推理的多样性和可靠性。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.
超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃
本文揭示了PPO-Clipping使用欧几里得度量导致LLM强化学习中的探索崩溃,并提出了黎曼等距策略优化(RIPO)以确保几何一致的策略更新,在AIME24上比GRPO提升了高达60%。