锁入口,内开阔:RLVR 如何缩窄解空间
摘要
本文通过分析多样性在何处丧失,研究了带有可验证奖励的强化学习如何缩窄大语言模型推理的解空间,发现其集中于轨迹的“入口”处。研究证明,无需牺牲准确性,即可通过干预措施恢复解的广度。
arXiv:2608.29188v1 公告类型:新
摘要:带有可验证奖励的强化学习显著提升了单样本准确率(pass@1),但导致策略的解空间收缩,从而削弱了测试时扩展的收益。本项工作探究了推理轨迹中这种多样性在何处丧失:策略是未能访问到一个有效的解族,还是在启动后未能执行计算?为区分访问与执行,我们分析了“倒计时”任务,其解空间可以详尽枚举为由第一个操作数和运算符定义的离散入口族,并考察了在 Qwen2.5-3B 上的 PPO 与 Qwen2.5-3B-Instruct 上的 GRPO。在这两种训练设置下,解的覆盖率下降了高达 67%,即使在所有检查点都解决的问题上也减少了一半。我们证明,这种收缩高度集中于入口处:在第一个算术运算之前,逐 token 似然值的变化是后续推理过程中的 11 到 16 倍。仅提供未被选择的入口前缀,就能将低访问族的补全率恢复超过一个数量级(在 PPO 下从 0.018 提升到 0.212),这表明其他解仍然可执行,只是未被启动。基于此定位发现,我们进一步发现,虽然表面提示无法恢复多样性,但针对入口的干预措施可以奏效:使用早期检查点进行晚层参数插值,能在不损失 pass@1 的情况下将解覆盖率提高 37%。最后,我们展示了在六个数学基准测试、7B 和 14B 模型上,早期步骤的熵坍塌现象会重复出现,但它并非推理优化的必然副产品:一个 SFT 基线保留了两倍以上的覆盖率,而分阶段的 SFT--DPO--RLVR 流水线则保留了早期步骤的熵。总而言之,推理广度是在门口丢失的,而非在房间内部丢失。代码:https://github.com/ershiyidian/early-branch-locking。
查看缓存全文
缓存时间: 2026/09/01 13:09
# 入口锁死,内里洞开:RLVR如何压缩解空间
来源:https://arxiv.org/html/2608.29188
Ruizhe Li
单位:伯明翰大学计算机科学学院
###### 摘要
基于可验证奖励的强化学习(RLVR)显著提升了单样本准确率(pass@1),但导致策略的解空间收缩,削弱了测试时扩展的收益。本研究探究推理轨迹中解空间宽度损失的具体位置:策略是未能**访问**有效解族,还是启动后未能**执行**计算?为区分"访问"与"执行",我们分析了倒计时任务——其解空间可通过首个操作数和运算符穷尽枚举为离散的"入口族",并基于Qwen2.5-3B上的PPO训练与Qwen2.5-3B-Instruct上的GRPO训练进行比较。两种训练设置下,解覆盖率最高下降67%,即使在所有检查点都能解决的问题上也减半。研究表明这种收缩高度集中于入口处:首个算术运算符前的逐token似然变化量是后续推理步骤的11倍至16倍。仅提供未选中的入口前缀,就能将低访问族的完成率恢复超过一个数量级(PPO下从0.018提升至0.212),证明替代方案仍可执行但不再被启动。基于此定位发现,我们发现表面提示无法恢复多样性,但针对性入口干预有效:晚期层参数插值结合早期检查点可在不损失pass@1的情况下将解覆盖率提升37%。最后,我们在六个数学基准测试中证实,7B和14B模型均出现早期步骤熵崩溃现象,但这并非推理优化的必然产物:SFT基线保留的覆盖率是RLVR的两倍以上,而SFT-DPO-RLVR阶段化流程能保持早期步骤熵。总之,**推理宽度损失发生在门口,而非房间内部**。
## 1 引言
基于可验证奖励的强化学习(RLVR)已成为激发大语言模型复杂数学推理的标准范式。与此同时,推理时计算技术(如重复采样、自洽性检验和验证器引导的树搜索)依赖于生成多样化候选轨迹来提升任务准确率。然而这两个方向存在根本矛盾:虽然RLVR显著提高了单样本准确率,但近期研究表明RLVR后策略会坍缩为狭窄的答案支撑集,推理多样性严重退化,这急剧削弱了重复采样的边际收益。现有研究试图通过奖励塑形、探索奖励和修改采样目标来量化或缓解这种收缩。但有效解损失的确切机制仍未明确。由于先前工作通过聚合最终答案计数或采样轨迹聚类评估多样性,它们混淆了两种不同的失败模式:策略可能未能**访问**有效解族(即从未启动路径),或在访问后未能**执行**(即在下游计算中偏离)。区分"访问"与"执行"至关重要,因为两种失败模式对应根本不同的恢复机制。
为解耦访问与执行,我们研究倒计时任务,其有效解空间可被穷举枚举,并按初始操作数和运算符划分为离散的"入口族"。我们通过自由生成覆盖率量化族访问,通过将提示固定为求解器指定的入口但保留所有下游算术开放来探测条件执行能力。我们在两种不同的RLVR实现中评估此框架:Qwen2.5-3B上的PPO训练轨迹与Qwen2.5-3B-Instruct的开源GRPO检查点序列。
**图1:入口划分解集**。对于{4,5,7,9}→24,求解器定义的入口按首个操作数和运算符对有效解进行分组。高亮的入口4×可接续以4×7和4×9开头的不同计算路径。RLVR在训练算法和检查点间系统性地诱导准确性-宽度权衡(§4)。通过追踪单样本准确率pass@1与完整测试分布下的穷举解空间覆盖率,我们观察到反比缩放关系:PPO下pass@1提升超50倍,但整体解覆盖率从0.337骤降至0.111。GRPO检查点序列呈现相同收缩:准确率三倍提升的同时解覆盖率下降43%。关键的是,这种收缩在所有检查点都能解决的子集上依然存在,表明即使问题难度远在模型能力范围内,解宽度也会崩溃。
**推理宽度损失发生在入口而非下游执行崩溃**(§5)。通过结合教师强制的对数似然阶段归因与入口固定采样,我们定位训练过程中概率质量的转移。首个算术运算符前的逐token对数似然散度是其后所有推理步骤的16倍(PPO)和11倍(GRPO)。此外,为模型提供最小的未选入口前缀,可将低访问族的完成率恢复超一个数量级(PPO下从0.018提升至0.212),而匹配前缀下的下游执行能力在训练中严格提升。因此,训练后的策略仍能执行多样解,只是不再主动选择它们。
**针对入口决策可在不降低单样本准确率的情况下恢复解多样性**(§6)。基于访问定位发现,我们评估了表面提示与解码调整相对于直接重新分配早期计算状态的干预措施。虽然方法提示和强制运算符转移无法恢复覆盖率,温度缩放会降低pass@1,但入口感知干预有效:特定层参数插值(混合晚期检查点第20-28层与第50步权重)可在不损失pass@1的情况下将解覆盖率提升37%。检查点采样与推理阶段logit混合通过解锁遗忘的开场轨迹,同样能恢复显著宽度。
**早期入口收缩泛化至多步数学基准与更大模型规模**(§7)。通过计算六个标准数学基准(GSM8K、MATH500、Minerva Math、Olympiad-Bench、AMC23和AIME24)上7B与14B Qwen架构的首次计算熵、同轨迹似然剖面和跨检查点轨迹多样性,我们确认RLVR一致触发早期分布崩溃。在扩展推理视野中,下游执行成为叠加的第二瓶颈,但入口选择仍是主要关卡。最后,评估替代训练范式表明宽度崩溃并非优化的必然产物:SFT模型保持的解覆盖率是RLVR的两倍以上,而OLMo-3的SFT-DPO-RLVR阶梯式训练在保持早期步骤计算熵的同时提升了pass@1。
综上,我们的贡献包括:
1. **访问与执行分解**:在倒计时任务上引入穷举状态空间分解框架,将解启动与下游推理执行分离。
2. **宽度损失机制定位**:证明PPO和GRPO下RLVR驱动的多样性崩溃集中于入口(似然变化量高11-16倍),而非下游算术失败所致。
3. **推理与权重空间恢复**:证明Transformer晚期层的参数插值与入口感知采样可恢复高达37%的解覆盖率,且不牺牲pass@1。
4. **基准测试与扩展泛化**:在七个数学基准上确认7B与14B模型的入口收缩现象,同时识别能规避此权衡的训练范式(如阶段性SFT/DPO对齐)。
## 2 相关工作
RLVR中的分布锐化与探索崩溃。RLVR究竟真正扩展了推理能力,还是仅重新加权预训练先验,仍存在激烈争论。虽然重复采样可扩展推理时性能,但在线RLVR常引发快速分布崩溃、赢者通吃模式锐化及解覆盖率下降。由于更新强化频繁采样的成功案例,访问不足的有效路径遭受叠加的探索惩罚。近期方法通过修改奖励函数、微分平滑或自适应探索目标来应对此问题。现有研究在聚合提示或最终答案层面评估可达性,而我们定位推理轨迹中有效解损失的具体位置,区分早期路径启动(访问)与下游计算(执行)。
**分叉点与前缀引导探索**。先前工作表明,自回归生成受稀疏高熵分叉token支配,这些token不成比例地决定下游轨迹语义。近期分析追踪从经验采样聚类得到的语义分支中的策略收缩,或使用推理前缀引导生成。然而,基于采样的聚类无法检测策略完全未访问的有效解分支。通过利用穷举枚举的状态空间,我们的框架将分支分析锚定于真实解图谱,使我们能够评估灭绝族并使用无信息的最小入口前缀探测执行能力。
**测试时扩展与权重空间恢复**。推理时搜索、自洽性检验和验证器引导的有效性根本受限于底层策略的可达性支撑。为对抗训练后多样性损失,近期方法集成时间检查点或跨训练阶段插值模型权重。我们提供了这些干预成功机制的解释:参数插值与检查点混合通过重新激活休眠的开场计算分支,同时保留策略精细的下游执行能力(附录J扩展讨论)。
## 3 设置:入口、访问与执行
**任务构建与训练范式**。倒计时实例指定一个目标整数和三或四个输入操作数集合。有效解是恰好等于目标的算术表达式,使用给定数字各一次,运算限于有效操作{+,-,×,÷}和括号。为确保算法通用性,我们考察两条独立的RLVR训练流程:
* **自主训练PPO**:遵循TinyZero框架,我们使用PPO训练Qwen2.5-3B,评估基础模型及从第25步到第275步保存的11个演员检查点。
* **公开GRPO检查点**:评估开源Qwen-2.5-3B-R1-countdown系列(使用TRL GRPO训练的Qwen2.5-3B-Instruct)。为防止评估泄露,我们将公开的50,000示例训练超集按排序后的输入-目标语义键过滤,生成严格不相交的135个求解器可行问题评估集。独立300问题验证扫描选择第25步为达到90%以上原生格式有效性的最早检查点,第450步作为晚期端点。两种设置均保持其原生提示模板与格式规范。
由于倒计时的有效状态空间可穷举枚举,我们可以追踪消失解的确切轨迹,监控概率质量如何在策略分布中迁移。
**解空间与覆盖率**。对于任意可行实例x,精确符号求解器生成完整有效算术表达式集,规范相似文章
当RLVR缩小推理边界:诊断Pass@k反转
本文诊断了可验证奖励强化学习(RLVR)中的“pass@k反转”现象:训练提高了单次准确率,但在重复采样下降低了性能,尤其是在正确轨迹稀少的边界提示上。提出了一种基于每个问题的基础锚定(PBA)方法来缓解这一问题。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
推理还是记忆?LLM强化学习中的方向感知多样性探索
本文介绍了DiRL,一种方向感知的强化学习框架,能够在LLM探索中区分推理驱动的多样性和记忆驱动的多样性。它从模型表示中提取内在的推理-记忆方向,并塑造奖励以优先考虑与推理一致的探索,在数学和通用推理基准上表现出改进。
从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
从 RLVR 到 RLSVR(GitHub 仓库)
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。