PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
摘要
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
arXiv:2607.16206v1 公告类型:新
摘要:本文介绍了PPO-HSC(Proximal Policy Optimization with High-order Sampling Coverage,即带有高阶采样覆盖的近端策略优化),一个旨在解决大型语言模型微调中模式坍塌的“无形枷锁”问题的探索性强化学习框架。标准的基于可验证奖励的强化学习(RLVR)虽然能有效强化高奖励轨迹,但往往导致模型过度优化已知解决方案,牺牲了好奇心和探索更广泛解空间的能力。为此,PPO-HSC引入了一种高阶采样覆盖(HSC)奖励,激励发现“低相似度但高有效性”的推理模式。通过维护一个已验证唯一解的动态轨迹库,该框架提供了一个可微分的信号,奖励语义新颖性,同时通过合理性约束确保结构合理性。在数学推理(GSM8K、SVAMP)和代码生成任务上的实证评估表明,PPO-HSC显著提升了解决方案的多样性和状态空间覆盖,同时保持或超越了当前最先进的强化学习基线的准确性和语法完整性。
查看缓存全文
缓存时间: 2026/07/21 06:37
# PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
来源:https://arxiv.org/html/2607.16206
11institutetext:湖南大学数学学院,长沙 410082,中国22institutetext:湖南大学计算机科学与电子工程学院,长沙 410082,中国
22email:jayshum@hnu\.edu\.cn, hwchen@hnu\.edu\.cn###### 摘要
本文提出PPO\-HSC(基于高阶采样覆盖的邻近策略优化),一种旨在解决大语言模型(LLM)微调中模式崩溃这一“无形枷锁”的探索性强化学习框架。虽然标准的基于可验证奖励的强化学习(RLVR)能有效强化高奖励轨迹,但这往往导致模型过度优化已知解,牺牲了好奇心和探索更广解决方案流形的能力。为克服这一问题,PPO-HSC引入了一种高阶采样覆盖(HSC)奖励,激励模型发现“低相似度却高有效性”的推理模式。通过维护一个已验证独特解的动态轨迹库,该框架提供了一个可微信号,在奖励语义新颖性的同时,通过合理性约束确保结构合理性。在数学推理(GSM8K, SVAMP)和代码生成任务上的实验评估表明,PPO-HSC显著提升了解决方案多样性和状态空间覆盖率,同时保持或超越了最先进的RL基线的准确性和语法完整性。我们的代码可在https://github.com/JJayshum/PPO-HSC获取。
## 1 引言
大语言模型(LLM)在复杂推理任务(从数学问题求解到自动代码生成)中展现了变革潜力。为了进一步使这些模型与人类意图对齐并优化性能,强化学习(RL)技术——最著名的有邻近策略优化(PPO)[1 (https://arxiv.org/html/2607.16206#bib.bib1)] 和基于可验证奖励的强化学习(RLVR)[3 (https://arxiv.org/html/2607.16206#bib.bib3)]——已成为事实标准。通过迭代强化高奖励轨迹,这些框架使LLM能够在巨大的决策空间中收敛到最优解。
尽管取得了成功,当前基于RL的微调范式存在一个我们称之为“无形枷锁”的关键局限。标准RL算法本质上是贪婪的;它们倾向于过度优化已知的高奖励路径,导致严重的模式崩溃。在这种状态下,模型仅仅充当“已知解的加速器”,而非创造性推理者。它趋向于策略空间中一个能立即获得奖励的狭窄子集,从而失去了探索更广阔、可能更优或更多样化解决方案流形的好奇心。这种探索压力的缺失阻碍了模型发现新颖的推理链或多样化的逻辑路径,而这些对于鲁棒的泛化至关重要。
为了打破这些枷锁,我们提出了PPO-HSC(基于高阶采样覆盖的邻近策略优化)。PPO-HSC的核心思想是通过将优化目标从简单的路径强化转向边界扩展来增强目标函数。具体来说,我们在标准目标奖励之外引入了一个高阶采样覆盖(HSC)奖励。通过维护一个基于基础模型的动态轨迹库,HSC机制为“低相似度却高有效性”的轨迹分配内在奖励。这确保了模型有动力去探索既区别于先前见过的模式、又在逻辑上合理的新颖推理模式。
参见图注图1:标准PPO与PPO-HSC的策略覆盖对比标准PPO(模式寻求)。标准算法表现出“模式寻求”行为,趋向于对单一路径的利用。这导致模式崩溃,模型仅加速已知解,而非探索更广阔的策略空间。PPO-HSC(广域覆盖):我们的框架通过奖励“低相似度却高有效性”的轨迹,将焦点转向边界扩展。这使得在推理流形上实现广域覆盖。机制:通过维护一个动态轨迹库D\\mathcal\{D\},PPO-HSC量化了生成序列相对于历史已知经验的新颖性。结果:模型有动力去发现多样化的、逻辑合理的推理链,同时保持高准确性。
#### 贡献
本文的贡献主要有三点:(i) 新颖框架:我们提出了PPO-HSC,一种探索性强化学习框架,将优化目标从单一路径利用重新定义为全面的采样空间覆盖。(ii) HSC奖励机制:我们设计了一种基于动态轨迹库的高阶采样覆盖奖励。该机制有效量化了生成序列的新颖性和结构合理性,为探索提供了细粒度信号。(iii) 实验验证:在多种多解推理任务上进行的大量实验表明,PPO-HSC显著增强了解决方案多样性和状态空间覆盖率,同时保持甚至超越了最先进RL基线的准确性。
## 2 相关工作
强化学习(RL)已成为将大语言模型与人类价值观和复杂推理需求对齐的基石。代表性框架如邻近策略优化(PPO)[1] 和直接偏好优化(DPO)[2 (https://arxiv.org/html/2607.16206#bib.bib2)] 在稳定训练过程和优化标量奖励信号方面展示了显著效果。具体在推理领域,基于可验证奖励的强化学习(RLVR)[3 (https://arxiv.org/html/2607.16206#bib.bib3)] 利用客观反馈(例如,编译器输出或数学正确性)引导模型走向正确解。然而,这些方法主要关注模式寻求行为,奖励模型找到通向正确答案的任何单一路径。这往往导致策略“变窄”,模型为了奖励稳定性而牺牲了解决方案多样性,这是我们要缓解的现象。
探索仍然是RL中最基本的挑战之一。传统方法通常依赖于内在动机,例如基于预测误差的好奇心驱动奖励[5 (https://arxiv.org/html/2607.16206#bib.bib5)],或基于计数的探索(惩罚频繁访问的状态)[4 (https://arxiv.org/html/2607.16206#bib.bib4)]。此外,熵正则化被广泛用于通过维持策略中最低水平的随机性来防止过早收敛[6 (https://arxiv.org/html/2607.16206#bib.bib6)]。虽然在低维或离散网格世界环境中有效,但这些技术在LLM高维、稀疏奖励的语义空间中常常失效。简单的词元级熵或状态计数无法捕捉推理链的结构或逻辑新颖性,往往导致“伪探索”——模型生成语义相同但句法不同的输出。
寻求“既要好又要不同”的解决方案的概念源于质量-多样性(QD)算法[7 (https://arxiv.org/html/2607.16206#bib.bib7)] 以及进化计算社区中的新颖性搜索[8 (https://arxiv.org/html/2607.16206#bib.bib8)]。像MAP-Elites[9 (https://arxiv.org/html/2607.16206#bib.bib9)] 这样的算法通过维护一个多样化且高性能的个体种群来聚焦于照亮搜索空间。虽然QD在机器人和过程化内容生成方面取得了成功,但其与现代深度RL(尤其是用于LLM)基于梯度的优化框架的集成仍然不易。PPO-HSC通过将QD“有效且多样”的理念优雅地提炼为一个可微奖励信号,弥合了这一差距。与通常依赖离散档案的传统QD不同,我们的方法利用高阶采样覆盖(HSC)机制在PPO框架内动态引导策略走向推理流形中未探索的区域。
## 3 方法
在本节中,我们详细阐述基于广域策略覆盖优化的探索性强化学习框架(PPO-HSC)。我们首先回顾大语言模型的标准强化学习设置,然后详细说明动态有效轨迹库的构建机制。在此基础上,我们推导出核心的高阶采样覆盖(HSC)奖励函数,最后给出PPO-HSC的整体优化目标和算法流程。
参见图注图2:PPO-HSC:广域策略覆盖优化框架。流程图展示了PPO-HSC框架的迭代强化学习循环:1. 初始输入:过程从策略模型(智能体)接收特定提示xx开始。2. 轨迹采样:框架执行M次采样以生成目标序列StargetS\_\{target\}以及一个备选轨迹的覆盖集CxC\_\{x\}。3. 高阶采样覆盖(HSC)模块:该核心组件通过测量目标序列、覆盖集和动态轨迹库D\\mathcal\{D\}之间的相似度来计算内在奖励。它包括可验证性过滤以检查正确性(Robj=1R\_\{obj\}=1),以及相对于参考模型的合理性约束(KL)以确保逻辑合理性。4. 最终奖励聚合:总奖励RtotalR\_\{total\}由HSC奖励(rhscr\_\{hsc\})、KL惩罚(rklr\_\{kl\})和目标/真实值奖励(rgtr\_\{gt\})聚合而成。5. PPO更新机制:聚合后的奖励通过GAE计算优势,用于通过梯度上升更新策略πθ\\pi\_\{\\theta\}。优化目标:该循环重复进行以实现广域覆盖和多样性提升,通过激励模型发现新颖、有效的推理路径来打破“模式崩溃”。
### 3.1 预备知识
在大语言模型(LLM)的强化学习微调中,文本生成过程通常被建模为马尔可夫决策过程(MDP)。给定初始提示xx,模型需要在当前上下文状态sts\_\{t\}下生成下一个词元at∈Va\_\{t\}\\in\\mathcal\{V\},其中V\\mathcal\{V\}是词汇表。策略πθ\(at\|st\)\\pi\_\{\\theta\}\(a\_\{t\}\|s\_\{t\}\)由参数化的LLM表示。在基于可验证奖励的强化学习(RLVR)中,模型生成完整轨迹τ=\(a0,a1,...,aT\)\\tau=\(a\_\{0\},a\_\{1\},\\dots,a\_\{T\}\)后,环境提供一个客观验证奖励Robj\(τ\)R\_\{obj\}\(\\tau\)。在代码生成或数学推理任务中,该奖励通常是一个极其稀疏的二进制奖励,即:
Robj\(τ\)=\{1,ifτpassed objective verification (e.g., unit tests or answer matching)0,otherwiseR\_\{obj\}\(\\tau\)=\\begin\{cases\}1,&\\text\{如果 \}\\tau\\text\{ 通过了客观验证(例如,单元测试或答案匹配)\}\\\\ 0,&\\text\{否则\}\\end\{cases\}
传统的PPO算法旨在最大化期望奖励Eτ∼πθ\[Robj\(τ\)\]\\mathbb\{E\}\_\{\\tau\\sim\\pi\_\{\\theta\}\}\[R\_\{obj\}\(\\tau\)\]。然而,当面对极其广阔的解空间时,一旦模型偶然发现了一个有效轨迹(Robj=1R\_\{obj\}=1),梯度更新会迅速增加该轨迹的概率。这导致模型陷入“无形约束”(即模式崩溃),失去了探索广阔动作空间以发现更好或更多样化解的能力。
### 3.2 动态有效轨迹库
为了引导策略突破已知的高奖励路径,PPO-HSC引入了一个动态维护的记忆模块:有效轨迹库D\\mathcal\{D\}。该库专门用于记录基础模型在极高采样次数(High-kk)下或当前策略在训练过程中探索到的所有已验证正确的独特轨迹。在训练步骤tt,轨迹库定义为一个有限集合:
Dt=\{τ1,τ2,...,τN\}\\mathcal\{D\}\_\{t\}=\\\{\\tau\_\{1\},\\tau\_\{2\},\\dots,\\tau\_\{N\}\\\}
库的更新遵循严格的准入机制:新采样的轨迹τnew\\tau\_\{new\}当且仅当满足Robj\(τnew\)=1R\_\{obj\}\(\\tau\_\{new\}\)=1且在语义或符号层面不包含在Dt\\mathcal\{D\}\_\{t\}中时,才会被添加到库中。为防止内存溢出并保持检索效率,当库大小超过设定阈值NmaxN\_\{max\}时,我们采用一种多样性贪婪策略。
具体来说,我们定义一个距离度量d\(τi,τj\)d\(\\tau\_\{i\},\\tau\_\{j\}\)来衡量任何两个有效轨迹之间的语义或结构不相似性。当一个新的已验证轨迹τnew\\tau\_\{new\}到达且当前库大小\|Dt\|≥Nmax\|\\mathcal\{D\}\_\{t\}\|\\geq N\_\{max\}时,我们构建一个临时扩展集D′=Dt∪\{τnew\}\\mathcal\{D\}^\{\\prime\}=\\mathcal\{D\}\_\{t\}\\cup\\\{\\tau\_\{new\}\\\}。然后我们评估D′\\mathcal\{D\}^\{\\prime\}中每个轨迹的边际多样性贡献,通常计算为它与集合中最近邻的距离。该策略迭代识别并驱逐对库整体多样性贡献最小的轨迹τevict\\tau\_\{evict\}。因此,更新后的库定义为Dt\+1=D′∖\{τevict\}\\mathcal\{D\}\_\{t\+1\}=\\mathcal\{D\}^\{\\prime\}\\setminus\\\{\\tau\_\{evict\}\\\}。这种驱逐机制确保了高度冗余的路径被剪除,同时保留一个固定大小的、最大化分散的高奖励例子子集,从而持续引导策略走向新颖的解空间。
### 3.3 高阶采样覆盖奖励(HSC)
高阶采样覆盖(HSC)奖励是PPO-HSC框架中内在激励的主要引擎。其核心设计理念是超越简单的奖励最大化,转而激励“边界扩展”。具体来说,该机制奖励那些相对于历史上已知的有效经验表现出显著语义或结构新颖性,同时又确保这些路径保持在模型合理的推理流形内的生成轨迹。HSC奖励在数学上被构建为两个相互制约项的组合:新颖性度量与合理性约束。
#### 新颖性度量
新颖性旨在计算当前轨迹τ\\tau与库Dt\\mathcal\{D\}\_\{t\}中最相似轨迹之间的距离。设φ\(⋅\)\\phi\(\\cdot\)为编码函数,它将离散序列映射为基础模型最后一层的平均池化表示:设轨迹τ\\tau定义为LL个离散词元的序列:τ=\(x1,x2,...,xL\)\\tau=\(x\_\{1\},x\_\{2\},\\dots,x\_\{L\}\)。当该序列由基础模型处理时,最后一层输出相应的稠密隐藏状态向量序列:H=\(h1,h2,...,hL\)H=\(h\_\{1\},h\_\{2\},\\dots,h\_\{L\}\)。这里,每个hi∈Rdh\_\{i\}\\in\\mathbb\{R\}^\{d\}表示第ii个词元的上下文嵌入,而dd是模型的隐藏维度。平均池化表示φ\(τ\)\\phi\(\\tau\)通过取这些隐藏状态向量的算术平均值计算得到。相似文章
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
PlanPO:面向多轮代理式大语言模型的群体规划感知策略优化
PlanPO是一种强化学习方法,它为多轮代理式大语言模型引入了从粗到细的优势信号,在ALFWorld、WebShop和SciWorld等基准测试中,性能比GRPO提高了27.2%。
近端策略优化
# 近端策略优化 来源: [https://openai.com/index/openai-baselines-ppo/](https://openai.com/index/openai-baselines-ppo/) OpenAI 我们推出了一类新的强化学习算法——近端策略优化(PPO),其性能与最先进的方法相当或更优,同时实现和调优都要简单得多。由于易用性和良好的性能,PPO 已成为 OpenAI 的默认强化学习算法。[策略梯度
提示引导的多样化策略优化用于LLM推理
本文介绍了提示引导的多样化策略优化(HDPO),这是一个两阶段强化学习框架,鼓励LLMs首先生成多个候选解决方案大纲(提示),然后选择最可靠的一个进行详细推理,从而提升推理的多样性和可靠性。