UP:打破探索-稳定性困境的无界正非对称优化
摘要
本文提出无界正非对称优化(UP),一种通用的即插即用目标函数,通过使用停止梯度锚定策略,解决了基于强化学习的大语言模型训练中的探索-稳定性困境,允许对正优势使用无裁剪梯度,同时对负优势进行裁剪。
arXiv:2607.06987v1 公告类型:新
摘要:强化学习(RL)已成为提升大语言模型(LLM)复杂推理能力的标准范式。为实现样本效率,现代强化学习框架依赖重要性采样(IS)。然而,这些算法面临探索-稳定性困境。纯重要性采样常导致灾难性的训练不稳定,而用于缓解此问题的标准裁剪机制会严格约束策略更新预算。通过形式化概率容量(Cap)概念,我们揭示保守裁剪通过过早截断正确但低置信度推理路径的更新预算,从结构上抑制了探索。为突破这些限制,我们提出无界正非对称优化(UP),一种通用的即插即用目标函数。UP通过停止梯度算子将策略锚定到当前状态,从理论上重构了优化过程。这种非对称设计为正优势释放无裁剪且稳定的梯度以最大化探索,同时对负优势保持标准裁剪保障以防止训练不稳定。此外,我们的公式可轻松扩展到不同优化粒度,包括词元级(GRPO、DAPO)和序列级(GSPO)框架。大量实验表明,UP在不同强化学习算法(DAPO、GSPO和GRPO)、模型架构(密集、MoE和视觉语言)及训练模式(语言和多模态)中均能增强探索能力并实现更优的推理准确率,验证了UP作为基于强化学习训练的通用即插即用增强方法的有效性。
查看缓存全文
缓存时间: 2026/07/09 07:46
# UP:打破探索-稳定性困境的无界正非对称优化 来源:https://arxiv.org/abs/2607.06987 查看 PDF (https://arxiv.org/pdf/2607.06987) > 摘要:强化学习 \(RL\) 已成为增强大型语言模型 \(LLMs\) 复杂推理能力的标准范式。为了实现样本效率,现代 RL 框架依赖重要性采样 \(IS\)。然而,这些算法面临着探索-稳定性困境。纯粹的 IS 常常导致灾难性的训练不稳定,而用于缓解这种不稳定的标准裁剪机制则严格约束策略更新预算。通过形式化概率容量(Probability Capacity,\(Cap\))的概念,我们揭示了保守的裁剪会过早地截断正确但低置信度推理路径的更新预算,从而从结构上扼杀探索。为了打破这些约束,我们提出了无界正非对称优化(Unbounded Positive Asymmetric Optimization,UP),一种通用的即插即用目标函数。UP 通过停止梯度算子将策略锚定到其当前状态,从理论上重构了优化过程。这种非对称设计为正优势释放了无裁剪、稳定的梯度以最大化探索,同时为负优势维持标准裁剪保障以防止训练不稳定。此外,我们的公式可轻松扩展到不同的优化粒度,包括令牌级(GRPO,DAPO)和序列级(GSPO)框架。大量实验表明,UP 能够增强探索能力,并在多种 RL 算法(DAPO、GSPO 和 GRPO)、模型架构(Dense、MoE 和视觉-语言)以及训练模式(语言和多模态)下实现更优的推理准确率,验证了 UP 作为基于 RL 训练的通用即插即用增强方法的有效性。 ## 提交历史 来自:Chongyu Fan [查看电子邮件 (https://arxiv.org/show-email/0063ed31/2607.06987)] **\[v1\]** 2026年7月8日星期三 04:21:42 UTC (1,700 KB)
相似文章
超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃
本文揭示了PPO-Clipping使用欧几里得度量导致LLM强化学习中的探索崩溃,并提出了黎曼等距策略优化(RIPO)以确保几何一致的策略更新,在AIME24上比GRPO提升了高达60%。
效用约束策略优化
本文介绍了一种简单而强大的方法,用于效用约束马尔可夫决策过程(UCMDPs),该方法无需预先固定约束界限即可实现风险敏感约束,在Safety Gymnasium基准测试中优于基线方法。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。
面向稀疏奖励强化学习的不确定性感知LLM引导策略塑形
提出ULPS,一种将校准的LLM集成到RL训练中的框架,通过不确定性调制的引导和基于A*的符号轨迹,在MiniGrid-UnlockPickup上实现了更高的成功率和样本效率。
优化训练策略的幻象:单调推理策略作为LLM强化学习的真正目标
我们介绍了MIPI(单调推理策略改进)及其实例化MIPU,这是一个用于LLM的两步RL框架,通过将优化与推理策略改进明确对齐来解决训练-推理不匹配问题。在FP8量化展开下,MIPU在Qwen3-1.7B和Qwen3-4B模型上实现了改进的推理性能和训练稳定性。