软自适应策略优化
摘要
SAPO引入了一个平滑、温度控制的门控机制,以自适应地减弱强化学习中的离策略更新,与使用硬裁剪的方法相比,提升了训练稳定性和性能。
查看缓存全文
缓存时间: 2026/08/16 15:37
论文页面 - 软自适应策略优化
来源: https://huggingface.co/papers/2511.20347
发布于 2025年11月25日
摘要
软自适应策略优化 (SAPO) 通过采用平滑的、温度控制的门控机制来自适应地衰减离策略更新,从而增强了大语言模型中强化学习的稳定性和性能,带来更优的训练稳定性和效果。
强化学习 (https://huggingface.co/papers?q=Reinforcement%20learning)(RL) 在提升大语言模型 (https://huggingface.co/papers?q=large%20language%20models)(LLMs) 的推理能力方面扮演着日益重要的角色,然而,稳定且高性能的策略优化 (https://huggingface.co/papers?q=policy%20optimization) 仍然面临挑战。基于令牌的重要性比率 (https://huggingface.co/papers?q=Token-level%20importance%20ratios) 通常表现出高方差——这一现象在混合专家模型 (https://huggingface.co/papers?q=Mixture-of-Experts%20models) 中更为突出——导致更新不稳定。现有的基于分组的策略优化 (https://huggingface.co/papers?q=policy%20optimization) 方法,如 GSPO (https://huggingface.co/papers?q=GSPO) 和 GRPO (https://huggingface.co/papers?q=GRPO),通过硬裁剪来缓解这一问题,但这使得同时保持稳定性和有效学习变得困难。我们提出了软自适应策略优化 (https://huggingface.co/papers?q=Soft%20Adaptive%20Policy%20Optimization)(SAPO),它用平滑的、温度控制的门控机制取代了硬裁剪,该机制在自适应地衰减离策略更新 (https://huggingface.co/papers?q=off-policy%20updates) 的同时保留了有用的学习信号。与 GSPO (https://huggingface.co/papers?q=GSPO) 和 GRPO (https://huggingface.co/papers?q=GRPO) 相比,SAPO 同时具备序列连贯性 (https://huggingface.co/papers?q=sequence-coherent) 和令牌自适应性 (https://huggingface.co/papers?q=token-adaptive)。如同 GSPO (https://huggingface.co/papers?q=GSPO),SAPO 保持了序列级别的连贯性 (https://huggingface.co/papers?q=sequence-level%20coherence),但其软门控机制形成了一个连续的置信区间,避免了 GSPO (https://huggingface.co/papers?q=GSPO) 中使用的脆弱的硬裁剪区间。当一个序列包含少量高度离策略的令牌时,GSPO (https://huggingface.co/papers?q=GSPO) 会抑制该序列的所有梯度,而 SAPO 仅选择性地下调问题令牌的权重,并保留接近在线策略令牌的学习信号,从而提高了样本效率 (https://huggingface.co/papers?q=sample%20efficiency)。相较于 GRPO (https://huggingface.co/papers?q=GRPO),SAPO 用平滑的、温度控制的缩放取代了硬的令牌级别裁剪,实现了更具信息量且更稳定的更新。在数学推理基准上的实证结果表明,在相当的训练预算下,SAPO 展现出更优的训练稳定性和更高的 Pass@1 性能 (https://huggingface.co/papers?q=Pass%401%20performance)。此外,我们使用 SAPO 训练了 Qwen3-VL 模型系列 (https://huggingface.co/papers?q=Qwen3-VL%20model%20series),证明了 SAPO 在不同任务和不同模型规模上均能带来一致的性能提升。总体而言,SAPO 为大语言模型的强化学习训练提供了一个更可靠、可扩展且有效的优化策略。
查看 arXiv 页面 (https://arxiv.org/abs/2511.20347) 查看 PDF (https://arxiv.org/pdf/2511.20347) 项目页面 (https://swift.readthedocs.io/en/latest/Instruction/GRPO/AdvancedResearch/SAPO.html) GitHub 15.2k auto (https://github.com/modelscope/ms-swift) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2511.20347)
在你的代理中获取此论文:
hf papers read 2511.20347
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2511.20347 以从本页链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2511.20347 以从本页链接。
引用此论文的 Spaces0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2511.20347 以从本页链接。
包含此论文的收藏集6
浏览包含此论文的 6 个收藏集 (https://huggingface.co/collections?paper=2511.20347)
相似文章
SAPO:用于智能体强化学习的单次展开自回归策略优化
SAPO 是一种用于智能体强化学习的低内存、高计算效率框架,它在单个自回归骨干中共享策略和价值函数,在 ALFWorld 和 WebShop 的实验中表现优于 PPO 和 GRPO。
CSPO:面向安全强化学习的约束敏感策略优化
本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。
@Chengxing_Xie: 清华大学引入了SAO算法,旨在解决异步强化学习中的离策略漂移和稳定性挑战……
清华大学的SAO算法解决了大规模语言模型异步强化学习中的稳定性和离策略漂移问题,在智能体编程和推理基准测试上相比GRPO取得了稳定提升,并用于训练GLM-5.2模型。
面向智能体强化学习的单次生成异步优化
本文提出了单次生成异步优化(SAO),以解决异步强化学习在智能体任务中的稳定性和离策略挑战,在编码和推理基准测试上优于GRPO及其变体。SAO已部署在GLM-5.2模型的智能体强化学习流程中。
StepPO:面向智能体强化学习的步骤对齐策略优化
StepPO 引入了一种面向智能体强化学习的步骤中心范式,该范式将策略优化与智能体决策粒度对齐,在多轮交互任务中优于以令牌为中心的方法。