当RLVR缩小推理边界:诊断Pass@k反转
摘要
本文诊断了可验证奖励强化学习(RLVR)中的“pass@k反转”现象:训练提高了单次准确率,但在重复采样下降低了性能,尤其是在正确轨迹稀少的边界提示上。提出了一种基于每个问题的基础锚定(PBA)方法来缓解这一问题。
arXiv:2607.20543v1 公告类型:新
摘要:可验证奖励强化学习(RLVR)可以提高单样本准确率,但同时使模型在重复采样下性能变差。我们研究这种 pass@k 反转:训练后,策略在较大的 $k$ 下可能比基础模型解决的独立问题更少。失败集中在边界提示上,这些提示中基础模型包含稀有的正确轨迹,这些轨迹可以通过采样恢复,但过于稀疏,无法可靠地出现在有限的 RLVR 展开组中。我们认为,一种双模式解释将其归因于证据缺失的失败:稀有的正确轨迹可能在 RLVR 采样并充分强化之前消失。主要贡献是这一诊断和机制框架。每个问题的基础锚定(PBA)是一个刻意简单的概念验证:用足够的冻结基础正确证据强化提示,并将有风险的提示锚定到基础分布。在 Omni-MATH-Test 上的三个训练种子中,以 MATH500 作为次要的高覆盖验证基准,PBA 在匹配的 GRPO 上同时改进了 \PassK{1} 和高预算覆盖。一项 3000 提示的受控诊断研究在所有种子上与预期特征一致:普通 GRPO 丢失了基础可解的边界提示,而 PBA 保留了稀有的验证器正向轨迹。我们使用数学验证器作为验证器引导优化的受控测试平台;相同的 pass@k 反转风险也适用于 ECCV 相关的视觉语言智能体,当重复的视觉、空间或图表推理尝试被外部工具或验证器检查时。推理后训练不仅应决定优化强度,还应决定哪些提示是安全的优化对象。
查看缓存全文
缓存时间: 2026/07/24 05:11
# 当 RLVR 缩小推理边界:诊断 Pass@k 反转
来源:https://arxiv.org/html/2607.20543
11institutetext:哈佛大学
###### 摘要
使用可验证奖励的强化学习 (RLVR) 能提升单次样本的准确率,却可能使模型在重复采样时的表现更差。我们研究这种 *pass@k 反转*:训练后的策略在较大的 k 下所解决的独特问题数可能少于其基座模型。失效集中在 *边界提示* 上 —— 基座模型包含少量可通过采样恢复的正确轨迹,但这些轨迹过于稀疏,无法在有限的 RLVR 轨迹组中可靠地出现。我们认为一种双模式解释可将其理解为证据缺失型失效:在 RLVR 能足够频繁地采样并强化之前,稀有的正确轨迹可能已经消失。本文的主要贡献在于这一诊断与机制框架。**逐问题基座锚定 (PBA)** 是一个刻意简化的概念验证:用足够的冻结基座正确证据来强化提示,并将有风险的提示锚定回基座分布。在 Omni-MATH-Test 上的三个训练种子中(以 MATH500 作为辅助的高覆盖率验证基准),PBA 在 **pass@1** 和高预算覆盖率上均优于匹配的 GRPO。一项包含 3000 个提示的受控诊断研究在种子间与预期特征一致:普通 GRPO 会丢失基座可解的边界提示,而 PBA 则能保留稀有的验证器正例轨迹。我们将数学验证器作为验证器引导优化的受控试验台;相同的 pass@k 反转风险同样适用于 **ECCV 相关的视觉-语言智能体** —— 只要重复的视觉、空间或图表推理尝试是通过外部工具或验证器进行检核的。推理后训练不仅应决定优化的强度,还应决定哪些提示适合优化。
## 1. 引言
使用可验证奖励的强化学习已成为改进推理模型的核心工具。在数学、代码及其他具有自动检查器的领域,自然的方法是采样一个解决方案、验证它,并强化成功的轨迹。这一策略通常能提升 **pass@1**,这类提升通常被解读为模型获得了更强的推理能力。但这种解读并不全面。推理模型不仅仅是单一答案的来源;它是一个关于可能尝试的分布。现代推理流程通过自一致性、验证器重排序、搜索、修复、代码执行和重复采样来利用这一分布。对于这些系统而言,关键问题不仅在于最顶层样本是否正确,更在于策略支持中是否仍有正确轨迹可达。
近期研究表明,RLVR 恰恰可能在这一维度上失效:它可以在提升 **pass@1** 的同时,降低大 k 下的 **pass@k**,以至于在允许多次尝试时,训练后策略所能解决的独特问题数少于基座模型 [22](https://arxiv.org/html/2607.20543#bib.bib22)。我们称这种失效为 *pass@k 反转*。熵崩塌是一个有用的症状,但并非充分的解释。对于简单提示,其主导采样模式本已正确,锐化是可取的。对于超出基座模型支持范围的提示,原本就没有多少覆盖率可以损失。破坏性案例出现在边界区间:那些在重复采样下存在正确轨迹,但它们并非主导模式的提示。正是这些提示凸显了大 k 推理的价值。基座模型在单次尝试中并不可靠,但它保留了潜在的解决方案质量,重复试错可将其恢复。
我们的核心主张是:pass@k 反转是一种 *边界模式承诺失效*。RLVR 不仅仅是降低熵;在边界提示上,它可能承诺远离稀有的正确模式。其机制并非全零奖励组直接奖励了错误答案。相反,全零组提供的局部纠错信号很弱,而稀疏的正例组以及训练中其他地方的共享参数更新,在正例分支被足够频繁地强化之前就已锐化了策略。实际效果是提示条件性的遗忘:训练后的策略变得更加自信,但同时破坏了原先通过重复采样可以恢复的覆盖率。
我们通过以下三个贡献使这一主张既精确又可操作。
* **诊断框架。** 我们根据冻结基座模型的行为,将提示分解为易解可解、可达、边界和不可达四个区间,从而将聚合的 pass@k 曲线转化为一个归因问题。
* **机制模型。** 我们给出一个理想化的双模式模型,其中有限样本的 RLVR 可能在观察到稀有的正确轨迹之前就承诺给错误模式,预测覆盖率损失应集中在边界提示上。
* **诊断验证。** 我们使用 **PBA**(一种极简的提示条件性基座锚定)作为干预探针,在三个训练种子上使用完整的 pass@k 曲线、一项 3000 提示的受控区间研究、匹配控制和门控消融进行评估。
本文的主要贡献是对 pass@k 反转的诊断与机制解释;**PBA** 是一个刻意简化的干预措施,表明该诊断可以指导更安全的优化。这一主张是有意限定的:**PBA** 并不会发现基座模型中不存在的解决方案模式,也不会取代蒸馏、课程学习、过程监督、工具使用或搜索。它解决的是一个更迫切的失效问题:当前的 RLVR 可能破坏基座模型已经拥有的覆盖率。防止这种破坏是评估未来方法是否真正扩展推理边界的前提条件。
我们将本文定位为 **ECCV 关于可靠验证器引导推理与评估** 的 workshop 投稿。我们使用数学验证器作为受控试验台,因为它们能孤立出验证器引导的 RLVR 效应;同样的 pass@k 反转风险也适用于 **视觉-语言智能体** —— 只要重复的视觉、空间或图表推理尝试是通过外部工具或验证器进行检核的。在这类系统中,VLM 之所以有用,往往正是因为大规模 **k** 搜索可以恢复稀有的正确视觉推理、程序或几何解;而一个能改善首样本却抹去这些稀有模式的 RL 步骤,会降低部署智能体在测试时计算下的可靠性。
## 2. 相关工作
### RLVR 与推理边界收缩。
诸如 PPO [16](https://arxiv.org/html/2607.20543#bib.bib16)、GRPO [17](https://arxiv.org/html/2607.20543#bib.bib17)、RLOO [1](https://arxiv.org/html/2607.20543#bib.bib1)、Reinforce++ [7](https://arxiv.org/html/2607.20543#bib.bib7)、ReMax [11](https://arxiv.org/html/2607.20543#bib.bib11) 和 DAPO [20](https://arxiv.org/html/2607.20543#bib.bib20) 等 RLVR 方法,使用自动可验证的结果奖励来优化语言模型。现代后训练栈已使此类过程在规模上日益实用 [18](https://arxiv.org/html/2607.20543#bib.bib18), [10](https://arxiv.org/html/2607.20543#bib.bib10)。它们的成功通常由 **pass@1** 来总结。Yue 等人 [22](https://arxiv.org/html/2607.20543#bib.bib22) 表明这并不完整:跨算法、模型家族和任务领域,RLVR 可以在提升 **pass@1** 的同时缩小大 k 的覆盖率。相关工作报告了多样性崩塌、熵崩塌,以及许多后训练推理行为源于基座模型而非由 RL 新发现 [21](https://arxiv.org/html/2607.20543#bib.bib21), [3](https://arxiv.org/html/2607.20543#bib.bib3), [15](https://arxiv.org/html/2607.20543#bib.bib15), [13](https://arxiv.org/html/2607.20543#bib.bib13), [23](https://arxiv.org/html/2607.20543#bib.bib23)]。最接近的是 Yuan 等人 [21](https://arxiv.org/html/2607.20543#bib.bib21),他们从过训练的角度看待多样性崩塌。而我们则孤立出有限样本中承诺给潜在混合错误侧的问题,并将冻结基座正确质量估计转化为提示级别的干预。
### 熵控制与保守优化。
最大熵 RL [5](https://arxiv.org/html/2607.20543#bib.bib5)、KL 正则化 RLHF [8](https://arxiv.org/html/2607.20543#bib.bib8)、保守离线 RL [9](https://arxiv.org/html/2607.20543#bib.bib9) 以及偏好优化方法 [14](https://arxiv.org/html/2607.20543#bib.bib14) 均认识到无约束优化会使策略过度集中。但全局熵控制难以应对 pass@k 反转。简单提示受益于锐化;边界提示需要熵保持。因此 **PBA** 是一个问题条件性的信任区域规则,而非统一的熵奖励。
### 蒸馏、搜索与支持扩展。
蒸馏和搜索可以通过改变可用于学生的轨迹来扩展覆盖率。缺乏外部探索的 RLVR 主要重新赋权从学生分布中采样的轨迹。这一区别对我们理论至关重要:pass@k 扩展需要增加正确模式质量 $w^*(x)$,而普通 RLVR 只能利用、保持或坍缩基座分布已有的内容。
## 3. 预置知识
设 $x \sim \mathcal{D}$ 是一个问题,$y \sim \pi(\cdot \mid x)$ 是生成的解决方案。验证器 [12](https://arxiv.org/html/2607.20543#bib.bib12) 返回 $r(x,y) \in \{0,1\}$。每个问题的成功概率是
\[ p_{\pi}(x) = \mathbb{E}_{y \sim \pi(\cdot \mid x)}[r(x,y)]. \tag{1} \]
按照标准的重复采样评估 [2](https://arxiv.org/html/2607.20543#bib.bib2),总体 pass@k 指标为
\[ \mathrm{pass}@k(\pi) = \mathbb{E}_{x \sim \mathcal{D}}\left[1 - (1 - p_\pi(x))^k\right]. \tag{2} \]
对于一个 $n=256$ 采样完成的问题和 $c_\pi(x)$ 个验证器正例完成,我们使用标准的有限样本估计量
\[ \widehat{\mathrm{pass}@k}(\pi; x) = 1 - \frac{\binom{n - c_\pi(x)}{k}}{\binom{n}{k}}, \tag{3} \]
当 $n - c_\pi(x) < k$ 时分子视为零。我们通过对 **NuminaMath 7B TIR** [6](https://arxiv.org/html/2607.20543#bib.bib6) (基座模型 $\pi_0$) 的 $n=256$ 完成结果进行缓存来构建 $p_{\pi_0}(x)$ 的估计值。对于原始 GRPO 训练,我们在每个 GRPO 组中使用 $G=8$ 次完成和独立的验证器结果。**PBA** 使用与 GRPO 相同的优化超参数、奖励、验证器和模型初始化,将 GRPO 更新替换为
\[ \mathbb{L}_{\text{PBA}}(\pi; x) = \text{GRPO-loss}(\pi; x) + \lambda \cdot \mathbb{1}[\text{anchor}(x)] \cdot \text{KL}(\pi \mid \pi_0), \tag{4} \]
但该公式掩盖了关键细节:$\text{anchor}(x)$ 条件由正确的基座估计确定。对于 $p_{\pi_0}(x) \geq \tau_{\text{low}}$ 的问题,$\text{anchor}(x)$ 返回真,否则返回假。我们在锚定那些基座已经具有**未来可行正确质量的提示**(低 $p_{\pi_0}$ 时没有质量可锚定)与不干扰易解提示($p_{\pi_0}$ 高)之间做出明确选择。额外的 KL 项针对 $\pi_0$ 的分布,作用于解码序列的最后一个标记位置(与 GRPO 中的 KL 惩罚区域相同)。我们在 8 个 A100 GPU 上使用 **GRPO Trainer (TRL)** [19](https://arxiv.org/html/2607.20543#bib.bib19) 训练。所有实验细节见附录 A。
## 4. 诊断框架
我们将提示的连续基座 $p_{\pi_0}(x)$ 离散为四个区间(表 1),将聚合的 pass@k 曲线转化为归因问题。
### 表 1:诊断区间划分
| 区间 | 定义(基于 $\pi_0$) | 预期 $\Delta \text{pass}@k$ 符号 |
| ------ | ------------------- | ----------------------------- |
| **SolvedEasy** | $p_{\pi_0}(x) > 0.6$ | 在大 k 下无变化或略有改善 |
| **Boundary** | $p_{\pi_0}(x) < 0.10$ 且 $1 - (1 - p_{\pi_0}(x))^{256} > 0.4$ | 在大 k 下为负 |
| **Reachable** | $0.10 \leq p_{\pi_0}(x) \leq 0.6$ | 在大 k 下变化不大(或略有负) |
| **OutOfReach** | $1 - (1 - p_{\pi_0}(x))^{256} \leq 0.4$ | 无变化 (或不可测) |
阈值并非基本常数;它们将提示区分为正确主导、稀有但可恢复、中等可达和本质缺失四个类别。我们将这些箱子用于诊断,并将对附近截断值的鲁棒性和通过 $p_{\pi_0}(x)$ 的连续分层视为所需证据的一部分。在诊断研究中,区间标签是根据与用于估计基座 pass@k 的评估完成独立的冻结基座校准缓存计算得出的。这避免机械地迫使边界提示的 $\text{pass}@256=1$。核心预测是大 k 的损失应集中在边界区间。
## 5. pass@k 反转的双模式理论
固定一个提示 $x$。将基座采样分布建模为
\[ \pi_0(y \mid x) = w^*(x) p_{+}(y \mid x) + (1 - w^*(x)) p_{-}(y \mid x), \tag{5} \]
其中 $p_{+}$ 是一个正确轨迹族,$p_{-}$ 是一个错误轨迹族。在理想化的二元情况下,
\[ \mathbb{E}_{p_{+}}[r(x,y)] = 1, \qquad \mathbb{E}_{p_{-}}[r(x,y)] = 0, \tag{6} \]
因此 $p_{\pi_0}(x) = w^*(x)$。标量 $w^*(x)$ 是正确模式质量。具有完全奖励期望的精确 KL 正则化 RL 会在 $w^*(x) > 0$ 时放大正确分支:玻尔兹曼重赋权给出 $p_{\pi_{\beta}}(x) = w^*(x) e^{\beta} / (w^*(x) e^{\beta} + 1 - w^*(x))$,随 $\beta$ 增加而增加。因此观察到反转不能用精确正则化最优解来解释。这是一种有限样本的训练现象。
每次 RLVR 更新都会看到一小批 Rollout。如果正确模式很少被采样,则大小为 $G$ 的批次包含零条正确轨迹的概率为
\[ \mathbb{P}[\text{无正例 Rollout} \mid x] = (1 - w^*(x))^G. \tag{7} \]
因此对于 $w^*(x) \ll 1/G$ 的边界提示,在熵开始下降之前,大多数更新不包含直接的正例证据。对于组相对方法,奖励模式很重要。设一个采样组有二元奖励 $r_1, \ldots, r_G$ 和归一化优势 $A_i = (r_i - \bar{r})/(s_r + \epsilon)$。四种情况相关:
1. **全零。** 如果每个 Rollout 的 $r_i=0$,则 $A_i=0$(取决于实现细节);该提示对 GRPO 奖励梯度贡献很小或没有直接贡献。这种情况不会直接强化错误模式。
2. **正好一个正例。** 正例轨迹获得正优势,负例获得负优势。这是直接强化正确分支的第一种情况,但在双模式近似下以概率 $G w^*(x)(1 - w^*(x))^{G-1}$ 发生。
3. **多个正例。** 正确轨迹获得持续的正相对证据,使得锐化安全。
4. **全为一。** 相对优势再次消失或变小;提示已经饱和,对区分模式贡献很小。
因此边界崩塌最好被理解为一种 **证据缺失型失效**,并结合共享的有限样本锐化,而非对全零错误组的正向奖励分配。在长序列的全零组期间,提示没有收到局部恢复信号,而来自易解提示和偶尔的提示内负例的更新可以降低熵并移动共享参数。如果在此漂移使稀有正确分支不可能之前,它未被采样,则高 k 的覆盖率就会丢失。
更一般地说,有限样本训练会诱导一个 **有效崩塌时域**:在此时间之前,保留的熵可能下降,或者先前观察到的正例答案集可能消失。这个时域并非 GRPO 的闭式属性;它取决于共享参数、优化器动态、数据顺序以及上述奖励模式。因此我们在本文中不估计校准的动态风险评分。相反,我们测试端点后果:如果在稀有正例被强化之前训练已经承诺,则会发生这种现象。我们通过模式承诺来近似该端点:存在一个有效阈值 $\tau$,使得
\[ \pi_{\mathrm{com}}(\cdot \mid x) = \begin{cases} p_{+}(\cdot \mid x), & w^*(x) \geq \tau, \\ p_{-}(\cdot \mid x), & w^*(x) < \tau. \end{cases} \tag{8} \]
###### 命题 1(理想化模式承诺下 pass@k 变化的符号)
在公式 (5) 和 (8) 下,每个问题的 pass@k 变化为
\[ \Delta_k(x) = \text{pass}@k(\pi_{\text{com}}; x) - \text{pass}@k(\pi_0; x) \]相似文章
叛逆的学生:通过自蒸馏 RLVR 反转教师信号以进行推理探索
本文介绍了 RLRT,这是一种在自蒸馏过程中反转教师信号的方法,旨在强化学生模型成功的偏离行为,从而增强大语言模型的推理探索能力。
RLVR中的奖励粒度:比较小语言模型数学推理中的过程奖励与结果奖励结构
本文系统比较了小语言模型在数学推理中用于可验证奖励强化学习(RLVR)的过程奖励与结果奖励结构。研究发现,仅过程监督相比仅结果监督显著提高了准确性和推理轨迹保真度,并分析了失败模式。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
CORA:通过一致性导向推理对齐分析与弥合多模态RLVR中的思考-答案差距
本文分析了大型视觉语言模型中多模态可验证奖励强化学习(RLVR)中的思考-答案不一致性,并提出CORA方法,该方法引入了一致性奖励模型和混合奖励优势拆分,以提高忠实性和任务性能。
理解从预训练到后训练的推理
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。