软自适应策略优化

Papers with Code Trending 论文

摘要

SAPO引入了一个平滑、温度控制的门控机制,以自适应地减弱强化学习中的离策略更新,与使用硬裁剪的方法相比,提升了训练稳定性和性能。

强化学习在增强大语言模型的推理能力方面扮演着越来越重要的角色,但稳定且高性能的策略优化仍然具有挑战性。词元级的重要性比率通常表现出高方差——这一现象在混合专家模型中被加剧——导致更新不稳定。现有的基于组的策略优化方法,如GSPO和GRPO,通过硬裁剪缓解这一问题,但难以同时保持稳定性和有效学习。我们提出软自适应策略优化,它用平滑、温度控制的门控机制取代硬裁剪,以自适应地减弱离策略更新,同时保留有用的学习信号。与GSPO和GRPO相比,SAPO既保持序列一致性又具备词元自适应性。与GSPO类似,SAPO维持序列级一致性,但其软门控形成连续的信任区域,避免了GSPO中使用的脆弱硬裁剪带。当序列包含少数高度离策略的词元时,GSPO会抑制该序列的所有梯度,而SAPO仅选择性地降低违规词元的权重,并保留接近在线策略词元的学习信号,从而提高样本效率。相对于GRPO,SAPO用平滑、温度控制的缩放取代了硬词元级裁剪,使得更新更具信息性和稳定性。在数学推理基准测试上的实验结果表明,在可比的训练预算下,SAPO表现出改进的训练稳定性和更高的Pass@1性能。此外,我们使用SAPO训练Qwen3-VL模型系列,证明了SAPO在不同任务和模型规模下都能带来一致的性能提升。总的来说,SAPO为LLMs的强化学习训练提供了更可靠、可扩展和有效的优化策略。
查看原文
查看缓存全文

缓存时间: 2026/08/16 15:37

论文页面 - 软自适应策略优化

来源: https://huggingface.co/papers/2511.20347
发布于 2025年11月25日

摘要

软自适应策略优化 (SAPO) 通过采用平滑的、温度控制的门控机制来自适应地衰减离策略更新,从而增强了大语言模型中强化学习的稳定性和性能,带来更优的训练稳定性和效果。

强化学习 (https://huggingface.co/papers?q=Reinforcement%20learning)(RL) 在提升大语言模型 (https://huggingface.co/papers?q=large%20language%20models)(LLMs) 的推理能力方面扮演着日益重要的角色,然而,稳定且高性能的策略优化 (https://huggingface.co/papers?q=policy%20optimization) 仍然面临挑战。基于令牌的重要性比率 (https://huggingface.co/papers?q=Token-level%20importance%20ratios) 通常表现出高方差——这一现象在混合专家模型 (https://huggingface.co/papers?q=Mixture-of-Experts%20models) 中更为突出——导致更新不稳定。现有的基于分组的策略优化 (https://huggingface.co/papers?q=policy%20optimization) 方法,如 GSPO (https://huggingface.co/papers?q=GSPO) 和 GRPO (https://huggingface.co/papers?q=GRPO),通过硬裁剪来缓解这一问题,但这使得同时保持稳定性和有效学习变得困难。我们提出了软自适应策略优化 (https://huggingface.co/papers?q=Soft%20Adaptive%20Policy%20Optimization)(SAPO),它用平滑的、温度控制的门控机制取代了硬裁剪,该机制在自适应地衰减离策略更新 (https://huggingface.co/papers?q=off-policy%20updates) 的同时保留了有用的学习信号。与 GSPO (https://huggingface.co/papers?q=GSPO) 和 GRPO (https://huggingface.co/papers?q=GRPO) 相比,SAPO 同时具备序列连贯性 (https://huggingface.co/papers?q=sequence-coherent) 和令牌自适应性 (https://huggingface.co/papers?q=token-adaptive)。如同 GSPO (https://huggingface.co/papers?q=GSPO),SAPO 保持了序列级别的连贯性 (https://huggingface.co/papers?q=sequence-level%20coherence),但其软门控机制形成了一个连续的置信区间,避免了 GSPO (https://huggingface.co/papers?q=GSPO) 中使用的脆弱的硬裁剪区间。当一个序列包含少量高度离策略的令牌时,GSPO (https://huggingface.co/papers?q=GSPO) 会抑制该序列的所有梯度,而 SAPO 仅选择性地下调问题令牌的权重,并保留接近在线策略令牌的学习信号,从而提高了样本效率 (https://huggingface.co/papers?q=sample%20efficiency)。相较于 GRPO (https://huggingface.co/papers?q=GRPO),SAPO 用平滑的、温度控制的缩放取代了硬的令牌级别裁剪,实现了更具信息量且更稳定的更新。在数学推理基准上的实证结果表明,在相当的训练预算下,SAPO 展现出更优的训练稳定性和更高的 Pass@1 性能 (https://huggingface.co/papers?q=Pass%401%20performance)。此外,我们使用 SAPO 训练了 Qwen3-VL 模型系列 (https://huggingface.co/papers?q=Qwen3-VL%20model%20series),证明了 SAPO 在不同任务和不同模型规模上均能带来一致的性能提升。总体而言,SAPO 为大语言模型的强化学习训练提供了一个更可靠、可扩展且有效的优化策略。

查看 arXiv 页面 (https://arxiv.org/abs/2511.20347) 查看 PDF (https://arxiv.org/pdf/2511.20347) 项目页面 (https://swift.readthedocs.io/en/latest/Instruction/GRPO/AdvancedResearch/SAPO.html) GitHub 15.2k auto (https://github.com/modelscope/ms-swift) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2511.20347)

在你的代理中获取此论文:

hf papers read 2511.20347

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2511.20347 以从本页链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2511.20347 以从本页链接。

引用此论文的 Spaces0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2511.20347 以从本页链接。

包含此论文的收藏集6

浏览包含此论文的 6 个收藏集 (https://huggingface.co/collections?paper=2511.20347)

相似文章

CSPO:面向安全强化学习的约束敏感策略优化

arXiv cs.AI

本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。

面向智能体强化学习的单次生成异步优化

Hugging Face Daily Papers

本文提出了单次生成异步优化(SAO),以解决异步强化学习在智能体任务中的稳定性和离策略挑战,在编码和推理基准测试上优于GRPO及其变体。SAO已部署在GLM-5.2模型的智能体强化学习流程中。