LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR

arXiv cs.CL 论文

摘要

本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。

arXiv:2607.28077v1 公告类型:新 摘要:基于可验证奖励的强化学习(RLVR)提升了大型语言模型的推理能力,但具有相同 rollout 奖励的提示组会消耗生成预算,却无法产生有效的学习信号。Rollout 前的提示选择可以通过在 rollout 生成之前筛选提示来减少这种浪费。然而,现有的 rollout 前方法难以平衡利用与探索:反复利用历史上有信息量的提示可能会缩小训练覆盖范围,而更广泛的探索则会降低信息丰富提示的比例。为解决这些局限,我们引入了 LEEPS,一种潜在引导的探索-利用提示采样器,它自适应地平衡对先前观察到的信息丰富提示的重复利用与对不确定提示的持续探索。LEEPS 将候选提示划分为利用组合和探索组合,并根据它们最近的非平凡比率自适应地分配 rollout 预算。它进一步利用表示空间中的邻居和历史的 rollout 结果来优先选择那些可能产生非零奖励方差的不确定提示,从而使探索更加有针对性,而无需额外的 rollouts。在六个数学推理基准上,LEEPS 在两种模型规模下均取得了最高平均分数,相对于 Qwen2.5-Math-1.5B 和 7B 的最强基线分别有 2.6% 和 3.7% 的相对提升,并且在训练过程中通常提升更快。在三个评估的 OOD 通用推理基准上,LEEPS 在两种模型规模下也取得了最高平均分数,并且每个训练步骤仅增加约 2 秒的在线采样开销。代码可在 https://github.com/ShuangLiangX/LEEPS 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:03

# LEEPS:面向大语言模型高效 RLVR 的潜在引导探索-利用提示采样

来源:https://arxiv.org/html/2607.28077

###### 摘要

基于可验证奖励的强化学习(RLVR)能提升大语言模型的推理能力,但具有相同 rollout 奖励的提示组会消耗生成预算却无法提供有效的学习信号。在 rollout 之前进行提示选择可以通过在生成前筛选提示来减少这种浪费。然而,现有的 pre-rollout 方法难以平衡利用与探索:反复利用历史上信息量高的提示会缩小训练覆盖范围,而更广泛的探索则会降低信息量高的提示占比。为解决这些局限,我们提出了 LEEPS,一种潜在引导的探索-利用提示采样器,它能在复用先前观察到的信息量高的提示与继续探索不确定提示之间进行自适应平衡。LEEPS 将候选提示划分为利用组合和探索组合,并根据它们最近的非平凡比率自适应地分配 rollout 预算。此外,它利用表示空间中的近邻和历史 rollout 结果来优先选择那些可能产生非零奖励方差的提示,从而在不增加额外 rollouts 的情况下使探索更具针对性。在六个数学推理基准上,LEEPS 在两种模型规模下均取得了最高平均得分,相对于最强基线,在 Qwen2.5-Math-1.5B 和 7B 上分别取得了 2.6% 和 3.7% 的相对提升,并且在训练过程中通常收敛更快。此外,在三个评估的 OOD 通用推理基准上,LEEPS 同样在两种模型规模下取得最高平均分,并且每个训练步仅增加了约 2 秒的在线采样开销。代码可在 https://github.com/ShuangLiangX/LEEPS 获取。

## 引言

强化学习已成为提升大语言模型(LLMs)推理能力的关键后训练阶段(Lambert et al. 2024 (https://arxiv.org/html/2607.28077#bib.bib1); Guo et al. 2025 (https://arxiv.org/html/2607.28077#bib.bib30); Yu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib12))。近期系统越来越多地采用基于可验证奖励的结果级强化学习(RLVR)用于推理任务(Yu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib12); Wen et al. 2025 (https://arxiv.org/html/2607.28077#bib.bib2); Xie et al. 2025 (https://arxiv.org/html/2607.28077#bib.bib3); Hu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib4)),并常与组相对策略优化(GRPO)(Guo et al. 2025 (https://arxiv.org/html/2607.28077#bib.bib30)) 结合使用。该范式使模型能够从可自动检查的最终答案中学习,减少了对基于偏好的奖励建模(Ouyang et al. 2022 (https://arxiv.org/html/2607.28077#bib.bib26))和逐步过程监督(Uesato et al. 2022 (https://arxiv.org/html/2607.28077#bib.bib5); Lightman et al. 2024 (https://arxiv.org/html/2607.28077#bib.bib6); Wang et al. 2024a (https://arxiv.org/html/2607.28077#bib.bib7))的依赖。然而,稀疏的结果奖励与组相对优势估计相结合会引入一个结构性的低效问题:平凡提示(要么太简单,要么太难)通常会产生奖励完全相同的 rollout 组,即所有响应要么全部正确,要么全部错误(Zheng et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib15))。这些零方差提示组对模型更新产生近乎消失的信号,却仍然需要昂贵的生成过程,导致无信息 rollouts 成为 RLVR 训练中计算浪费的主要来源。

参见图注

图 1:Qwen2.5-Math-7B 上的训练动态。左图:180 个训练步内的非平凡提示比率。右图:第 180 步时提示选择次数的互补累积分布,显示了至少被选择 k 次的训练提示所占比例。

现有方法试图通过选择提示来提高非平凡提示的占比。在线过滤方法采用“先观察后过滤”的策略:首先为采样到的提示生成 rollouts,然后丢弃零方差组(Yu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib12); Zhang et al. 2025b (https://arxiv.org/html/2607.28077#bib.bib14); Xu et al. 2025 (https://arxiv.org/html/2607.28077#bib.bib25))。尽管这些方法有效,但它们仍会在最终产生零方差组的提示上消耗大量计算资源。较新的方法将提示选择提前到 rollout 之前,通过从 rollout 历史中预测提示的信息量。具体而言,DPS(Mao et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib19))对提示求解动态进行建模,以优先选择可能具有信息量的提示,而 MoPPS(Qu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib18))则使用提示成功率的后验采样,倾向于预测难度居中的提示。尽管 pre-rollout 选择避免了在线过滤所需的额外 rollouts,但它也引入了新的挑战。如图 1 (https://arxiv.org/html/2607.28077#Sx1.F1) 所示,DPS 通过反复选择较小的提示子集来维持较高的非平凡比率,导致潜在有用的训练数据未被使用,而 MoPPS 虽然实现了更广泛的覆盖,但产生了较低的非平凡比率,尤其是在训练早期。这种设定带来了两个核心挑战。首先,探索本身可能引入零方差组,从而降低训练批次的非平凡比率。其次,在固定的探索预算下,采样器必须在没有额外 rollout 反馈的情况下更有效地识别潜在有用的提示,从而降低探索成本。为解决这些挑战,我们提出了 LEEPS,一种用于高效 RLVR 的潜在引导探索-利用提示采样器。如图 1 (https://arxiv.org/html/2607.28077#Sx1.F1) 所示,LEEPS 在维持一贯较高的非平凡提示比率的同时,覆盖了比 DPS 明显更多的提示,从而在训练批次信息量与探索潜在有用提示之间取得了平衡。具体而言,LEEPS 建立在两个互补设计之上:**自适应探索-利用组合分配**和**潜在引导探索**。

首先,自适应探索-利用组合分配缓解了探索导致的训练批次非平凡比率下降。它将候选提示划分为利用组合(由已产生信息性 rollout 信号的提示组成)和探索组合(由效用仍不确定的提示组成)。LEEPS 利用最近的 rollout 结果来估计每个组合产生的非平凡比率,并调整它们的批次配额,使所选训练批次的预期非平凡比率保持在预定义目标附近。这种自适应分配在保留足够探索预算的同时维持了较高的非平凡比率。

其次,潜在引导探索在不增加额外 rollouts 的情况下提高了探索不确定提示的效率。它使用模型隐藏状态表示提示,并利用潜在空间中最近邻的已观测结果来估计每个探索候选的潜在成功率。图 3 (https://arxiv.org/html/2607.28077#Sx3.F3) 表明,潜在信息为筛选不确定提示提供了有用信号,支持了我们的潜在引导探索策略。这使得固定的探索预算能够优先考虑更可能产生非零奖励方差的不确定提示。

最后,我们在两个 Qwen2.5-Math 模型规模上,跨六个数学推理基准对 LEEPS 进行了评估。在无需为提示选择生成额外 rollouts 的情况下,LEEPS 在 1.5B 和 7B 模型上的整体得分分别比最强基线高出 2.6% 和 3.7%。此外,它还在两个模型规模下的三个 OOD 通用推理基准上取得了最高平均得分,表明其收益不仅限于数学推理任务。进一步的分析表明,LEEPS 保持了较高的非平凡比率,通常比基线收敛更快,并且每个训练步仅产生约 2 秒的在线采样开销。

参见图注

图 2:LEEPS 概览。候选提示被划分为利用组合和探索组合,并根据它们最近的提示非平凡比率自适应分配训练预算。利用分支根据成功率对先前观察到的非平凡提示进行加权,而探索分支则通过潜在近邻估计来识别并优先选择潜在信息量高的提示。Rollout 结果会更新提示统计信息,用于后续的提示采样。

## 预备知识

**RLVR 中的零方差提示组。** 组相对策略优化(GRPO)(Shao et al. 2024 (https://arxiv.org/html/2607.28077#bib.bib31))被广泛用于基于可验证奖励的强化学习(RLVR)。给定一个提示 \(p\),旧策略采样一组 \(G\) 个响应 \(\{y_{p,j}\}_{j=1}^{G}\)。我们使用二元可验证奖励 \(R(p,y_{p,j})\in\{0,1\}\),其中最终答案正确时获得奖励 \(1\),否则获得奖励 \(0\)。GRPO 通过在其 rollout 组内对每个奖励进行归一化来计算组相对优势:

\[
A_{p,j}=\frac{R(p,y_{p,j})-\bar{R}_{p}}{\operatorname{std}(\mathbf{R}_{p})},
\tag{1}
\]

我们将提示 \(p\) 的 rollout 结果总结为其组成功率:

\[
a(p)=\frac{1}{G}\sum_{j=1}^{G}R(p,y_{p,j}).
\tag{2}
\]

当 \(a(p)=0\) 或 \(a(p)=1\) 时,组内所有响应获得相同奖励,因此每个响应的 \(A_{p,j}=0\)。我们将采样到的 rollout 组称为**零方差组**,并将提示 \(p\) 在该训练步视为**平凡提示**。相反,如果 \(0<a(p)<1\),则提示组是**非平凡**的,因为它能提供非零的学习信号。

**Pre-Rollout 提示选择。** 我们定义一个候选批次 \(\mathcal{B}_{\mathrm{cand}}\),它从整个训练集中采样而来,且满足 \(|\mathcal{B}_{\mathrm{cand}}|>B\),参照先前工作(Qu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib18); Mao et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib19)),其中 \(B\) 是每次 GRPO 更新所用提示的数量。在生成 rollouts 之前,一个 pre-rollout 选择器仅使用选择时可用信息,从 \(\mathcal{B}_{\mathrm{cand}}\) 中选择子集 \(\mathcal{B}_{\mathrm{train}}\),且满足 \(|\mathcal{B}_{\mathrm{train}}|=B\)。只有被选中的提示才会被 rollout 并用于后续策略优化。目标是在不产生额外选择用 rollouts 的情况下,主动探索效用仍不确定的提示,同时保持所选训练批次具有较高的非平凡比率。

## 方法

本节介绍 LEEPS,一种用于高效 RLVR 的潜在引导探索-利用提示采样器。如图 2 (https://arxiv.org/html/2607.28077#Sx1.F2) 所示,给定候选批次 \(\mathcal{B}_{\mathrm{cand}}\),LEEPS 通过两个组件选择训练批次 \(\mathcal{B}_{\mathrm{train}}\):**自适应探索-利用组合分配** 在利用组合和探索组合之间分配 rollout 预算,以及 **潜在引导探索** 利用潜在近邻信息在探索组合内部引导采样。选中的提示完成 rollout 后,LEEPS 使用观测结果更新它们的成功率和选择次数,从而为后续选择步骤提供历史信号。

### 自适应探索-利用组合分配

为了在不牺牲广泛探索的前提下维持较高的非平凡比率,我们首先引入了自适应探索-利用组合分配。如图 1 (https://arxiv.org/html/2607.28077#Sx1.F1) 所示,MoPPS(Qu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib18))探索了训练集的较大部分,但在训练早期产生的非平凡提示组比率较低。相比之下,DPS(Mao et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib19))通过集中在估计有用的提示上保持了较高的非平凡比率,但因此复用了较小范围的提示子集,留下了可能非平凡的提示未被探索。为了平衡非平凡比率和提示覆盖率,LEEPS 将 pre-rollout 提示选择表述为在两个互补提示组合之间对固定 rollout 预算的自适应分配。给定一个扩大的候选批次 \(\mathcal{B}_{\mathrm{cand}}\),LEEPS 根据其最近观测到的组成功率 \(\hat{a}_{p}\) 和被选择进行 rollouts 的次数 \(n_{p}\) 来划分候选提示。利用组合包含先前被选中的非平凡提示,而探索组合包含未观测到的提示以及最近 rollout 组为零方差的提示。LEEPS 随后根据两个组合最近的非平凡比率,从两个组合中自适应分配提示来构建 \(\mathcal{B}_{\mathrm{train}}\)。

**利用组合。** 利用组合包含已经产生非零奖励方差的提示:

\[
\mathcal{P}_{\mathrm{exploit}}=\{p \mid n_{p}>0,\; 0<\hat{a}_{p}<1\}.
\tag{3}
\]

这些提示很可能提供有用的学习信号,因为当前策略有时能解决,有时会失败。LEEPS 从利用组合中进行加权采样,每个提示的采样概率与其伯努利方差权重成正比:

\[
w_{\mathrm{exploit}}(p)=\hat{a}_{p}(1-\hat{a}_{p}),
\tag{4}
\]

该权重在 \(\hat{a}_{p}=0.5\) 时取得最大值,并随着提示变得更简单或更难而降低。因此,这种加权偏向于难度居中的提示,这与先前研究中“这些提示对模型学习最具信息量”的发现一致(Bae et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib11); Chen et al. 2025 (https://arxiv.org/html/2607.28077#bib.bib20); Qu et al. 2026 (https://arxiv.org/html/2607.28077#bib.bib18))。

**探索组合。** 探索组合包含在当前策略下效用仍不确定的提示。它既包括未观测过的提示,也包括最近 rollout 结果为零方差的提示:

\[
\mathcal{P}_{\mathrm{explore}}=\{p \mid n_{p}=0\}\cup\{p \mid n_{p}>0,\; \hat{a}_{p}\in\{0,1\}\}.
\tag{5}
\]

将这些提示保留在探索组合中可以防止采样器在有限或无信息观测后过早丢弃提示。这一点很重要,因为在训练某一阶段为零方差的提示可能随着策略演化而变得有用。LEEPS 不会随机采样该组合;相反,它会使用潜在近邻估计的潜在成功率来优先探索候选提示,细节将在下一小节中说明。令 \(\hat{a}_{p}^{\mathrm{lat}}\) 表示这一潜在近邻估计成功率。LEEPS 为每个探索提示分配一个计数衰减的潜在不确定性分数,并选择分数最高的提示:

\[
w_{\mathrm{explore}}(p)=\frac{1-2|\hat{a}_{p}^{\mathrm{lat}}-0.5|}{\sqrt{n_{p}+1}},
\tag{6}
\]

该分数偏向于潜在近邻估计表明难度居中的提示,并抑制对相同提示的反复探索。

**自适应分配。** LEEPS 旨在使所选训练批次的非平凡比率保持在预定义目标 \(\tau\)(例如,0.9)附近。为实现这一目标,LEEPS 通过 \(\rho\) 控制探索-利用分配,其中 \(\rho\) 是分配给探索组合的批次比例。具体而言,大约 \(\rho B\) 个提示从探索组

相似文章

借助大语言模型发现强化学习接口

Hugging Face Daily Papers

本文介绍了 LIMEN,这是一个由大语言模型引导的演化框架,能够通过联合优化原始模拟器状态的观测映射与奖励函数,自动发现强化学习接口。该方法有效降低了人工设计成本,并证明了观测与奖励的协同设计优于单独优化其中任意单一组件。

ExpRL:面向LLM中期训练的探索式强化学习

Hugging Face Daily Papers

ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。