超越稳定性-探索困境:LLM策略优化的环境正则化

Hugging Face Daily Papers 论文

摘要

本文介绍了ERPO,一种通过控制查询分布将正则化从动作侧转移到输入侧的方法,解决了LLM策略优化中的稳定性-探索困境,并在数学推理基准测试中展示了改进。

针对大型语言模型的策略优化(PO)面临稳定性-探索权衡,目前由动作侧的Policy-KL正则化器介导。这使实践者陷入两难:保留Policy-KL会约束响应行为并消耗动作侧的探索预算,而移除它则导致优化没有明确的漂移控制。我们主张一种替代方案,通过将正则化转移到输入侧来打破这一困境。随着训练的进行,当前策略诱导的训练查询分布不受控制地偏离其预强化学习参考分布。 具体来说,环境正则化策略优化(ERPO)引入了一个查询-KL(QKL)项来约束查询分布偏移,以及一个从数据集静态参考导出的每查询权重,使每个查询更新偏向于参考分布下的典型查询。QKL梯度严格通过查询似然流动;策略梯度估计器使用的响应得分函数不出现在QKL项中,因此QKL对响应分布不施加直接梯度压力——探索得以保留。ERPO可以无缝集成到GRPO/PPO/REINFORCE风格的流程中,无需额外的前向传播。在六个数学推理基准测试中,ERPO替代了标准的Policy-KL正则化器,同时有效控制查询分布漂移,在高温度解码和长期训练下提供更强的准确性和显著更稳定的行为。我们的源代码可在https://github.com/alibaba/ERPO获取。
查看原文
查看缓存全文

缓存时间: 2026/08/25 08:34

论文页面 - 超越稳定性与探索的困境:大语言模型策略优化的环境正则化

来源: https://huggingface.co/papers/2608.23311 发布于 8月24日

·

由 https://huggingface.co/xinyu1607 提交

he (https://huggingface.co/xinyu1607) 于8月25日发布

摘要

ERPO 用输入侧的查询分布控制取代了动作侧的策略正则化,以在保持响应探索性的同时稳定大语言模型的强化学习。

大语言模型的策略优化 (https://huggingface.co/papers?q=Policy%20optimization) (PO) 面临稳定性与探索的权衡,目前主要通过动作侧的策略-KL正则化器 (https://huggingface.co/papers?q=Policy-KL%20regularizer) 来调节。这使实践者陷入两难:保留策略-KL会约束响应行为并消耗动作侧的探索预算;而放弃它则使优化过程缺乏明确的漂移控制。我们主张采用一种替代方案,通过将正则化转移到输入侧来打破这一困境。随着训练进行,由当前策略诱导的训练查询分布会不受约束地偏离其强化学习前的参考分布。具体来说,环境正则化策略优化 (https://huggingface.co/papers?q=Environment-Regularized%20Policy%20Optimization) (ERPO) 引入了一个查询-KL (https://huggingface.co/papers?q=Query-KL) (QKL) 项来约束这种查询分布偏移,并结合一个基于数据集静态参考分布的、针对每个查询的权重,将每个查询的更新偏向参考分布下的典型查询。QKL的梯度严格通过查询似然传递;策略梯度估计器 (https://huggingface.co/papers?q=policy-gradient%20estimators) 使用的响应评分函数不会出现在QKL项中,因此QKL不会对响应分布施加直接的梯度压力——探索性得以保留。ERPO 可直接插入 GRPO (https://huggingface.co/papers?q=GRPO)/PPO (https://huggingface.co/papers?q=PPO)/REINFORCE (https://huggingface.co/papers?q=REINFORCE) 风格的流水线中,无需额外的前向传播。在六个数学推理基准测试中,ERPO 替代了标准的策略-KL正则化器 (https://huggingface.co/papers?q=Policy-KL%20regularizer),有效控制了查询分布漂移,在高温解码和长期训练下提供了更强的准确性和显著更稳定的行为。 我们的源代码可在 https://github.com/alibaba/ERPO 获取

查看 arXiv 页面 (https://arxiv.org/abs/2608.23311) 查看 PDF (https://arxiv.org/pdf/2608.23311) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23311)

通过您的智能体获取此论文:

hf papers read 2608\.23311

没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.23311 以从本页面关联。

引用此论文的数据集 0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.23311 以从本页面关联。

引用此论文的空间 0

没有空间关联此论文

在空间的 README.md 中引用 arxiv.org/abs/2608.23311 以从本页面关联。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面关联。

相似文章

VERPO:验证证据正则化策略优化

arXiv cs.LG

VERPO 引入了一个框架,用于在语言模型中进行验证证据正则化策略优化,通过将证据视为策略修正的提议,同时保持目标结果,以提高在科学推理和工具使用任务上的性能。

重新思考LLM强化学习中的散度正则化

Hugging Face Daily Papers

本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。

ESPO:早期停止近端策略优化

Hugging Face Daily Papers

ESPO为强化学习引入了一种早期停止机制,能够检测并终止大语言模型中失败的推理轨迹,从而提升数学推理性能,同时减少超过20%的计算量。