解锁不可解难题:教师引导的课程学习实现数据高效RLVR

arXiv cs.CL 论文

摘要

本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。

arXiv:2609.13997v1 公告类型:新 摘要:强化学习与可验证奖励(RLVR)在提升大型语言模型的数学推理能力方面取得了显著成功。然而,超出模型当前能力的问题,其中所有推演均失败且无法产生学习信号,尽管标志着最具信息性的训练前沿,但在结构上被浪费。我们证明,这些原本无法激活的问题可以通过教师引导的课程学习来解锁:来自更强模型的部分推理轨迹创建了分级的难度景观,一个反向链接课程逐步撤回指导,直到模型独立解决问题。仅在128个不可解问题上训练,在基础模型的九个基准平均上,匹配或超越了在完整2000个问题语料库(约16倍数据效率)上训练的GRPO,同时显著扩展了在大k值下通过pass@k衡量的推理边界。此外,我们识别出在纯不可解领域中特别严重的分布偏移成本,并提出了单调前沿课程(MFC),这是一种单调驱动训练向无指导求解的方法,始终优于现有课程方法。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:48

# 教师引导的数据高效RLVR课程学习
来源:https://arxiv.org/html/2609.13997

## 解锁不可解难题:教师引导的数据高效RLVR课程学习
Zhen Han††
注:本研究独立于Amazon进行,与作者在Amazon的职位无关。
所属机构:Amazon  
邮箱:[[email protected]](mailto:)

###### 摘要
可验证奖励强化学习(RLVR)在提升大语言模型数学推理能力方面展现出显著成效。然而,超出模型当前能力范围的问题——当所有推理路径均失败且无法产生学习信号时——尽管标示着最具信息量的训练前沿,却在结构上被浪费。我们证明,这类原本无效的问题可通过*教师引导的课程学习*实现*解锁*:来自更强模型的部分推理轨迹创建了梯度难度景观,而后链式课程逐步撤除引导直至模型独立解题。仅在128个不可解问题上训练,即可在9项基准平均表现中达到或超越在完整2000个问题语料库上训练的GRPO(数据效率提升约16倍),同时显著扩展通过pass@kk(大k值)衡量的推理边界。此外,我们识别出在纯不可解问题情境下尤为显著的分布偏移代价,并提出*单调前沿课程*——该方法通过单调驱动训练趋向无引导解题,持续优于现有课程方法。

## 1 引言
参考标题图1:我们的不可解课程学习流程概览。上路径:在完整2000个混合难度问题语料库上进行标准GRPO训练。下路径:筛选出其中147个不可解问题(学生模型pass@64=0),使用更强教师生成分步结构化轨迹,丢弃教师失败案例(剩余136个),选取最短的128个示例作为课程训练集。我们比较三种后链式课程:混合(R3)、AdaBack和我们的MFC。MFC专为纯不可解情境设计。使用约16倍更少的源数据,课程方法在跨基准平均表现(右图;Qwen3-1.7B,9项基准)上达到或超越GRPO基线。

以推理为中心的大语言模型(LLMs)OpenAI (2024) (https://arxiv.org/html/2609.13997#bib.bib1); Guo et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib2) 已确立可验证奖励强化学习(RLVR)Shao et al. (2024) (https://arxiv.org/html/2609.13997#bib.bib3) 作为提升数学推理的强大方案。RLVR建立在更广泛的人类反馈强化学习范式 Ouyang et al. (2022) (https://arxiv.org/html/2609.13997#bib.bib41) 和策略梯度方法 Schulman et al. (2017) (https://arxiv.org/html/2609.13997#bib.bib7) 基础之上,用可验证奖励信号替代昂贵的人工标注。尽管多数研究聚焦于算法优化 Yu et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib4); Liu et al. (2025b) (https://arxiv.org/html/2609.13997#bib.bib5); Cui et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib6),但一个互补问题正受到日益关注:*哪些训练数据最为关键*?Pikus et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib8) 表明最难题目带来最大收益,Foster et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib9) 显示预期策略改进受限于成功方差。Wang et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib10) 证明即使单个样本也能解锁显著推理收益。这些发现指向共同主题:位于模型可靠解题边界附近、具有混合推理结果的问题,往往为RLVR提供最丰富的学习信号。

另一研究线索涉及RLVR可教授的*范围*。Yue et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib14) 发现标准RLVR通过放大基础模型中已有的受奖励轨迹提升pass@1,在大k值时基础模型匹配或超越RL训练模型,且覆盖范围可能收缩。Havrilla et al. (2024) (https://arxiv.org/html/2609.13997#bib.bib15) 发现RL微调未能探索远超监督微调后可用解决方案的范围。模型的*推理边界*111 遵循Yue et al. (2025)的用法,此处"推理边界"指给定足够采样时模型可解问题集合,通过大k值的pass@k进行操作化定义。因此在标准训练后往往趋于平台期甚至收缩。Yao et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib16) 将扩展与收缩视为概率质量重分配的两个阶段:早期利用可能缩小覆盖范围,而扩展需要延续至后期探索阶段的训练。

那么,对于*在操作上超出*该边界的问题呢?在挑战性领域中,有相当比例的问题是*不可解的*:即使在宽松预算(例如pass@64=0)下,所有采样推理路径均失败。我们发现2000个竞赛数学语料库中约7%的问题对Qwen3-1.7B不可解。这些问题呈现悖论:它们标示着模型的推理边界并携带显著学习潜力,但在标准GRPO下,均匀失败导致优势值消失且梯度近乎为零。这促使我们提出核心问题:
> *不可解问题能否被解锁用于RLVR,且仅凭它们能否驱动数据高效的推理改进与边界拓展?*

我们给出肯定答案。核心洞察在于:来自更强教师的部分推理轨迹将单个不可解问题转化为具有梯度难度的*状态族*,由引导级别ρ∈[0,1]控制教师推理的揭示程度。随后可对ρ执行后链式课程,逐步撤除引导直至无辅助解题。图1(https://arxiv.org/html/2609.13997#S1.F1)总结了该流程。使用后链式课程Amani et al. (2026) (https://arxiv.org/html/2609.13997#bib.bib18) 在128个不可解问题上训练,在两个基础模型的9项基准平均表现上达到或超越完整2000问题语料库的GRPO(数据缩减约16倍),并*显著扩展*推理边界(AIME的pass@k在所有k直至256时均有提升)。我们进一步观察到现有后链式课程未针对纯不可解情境优化。引导级别ρ>0的每个训练步骤所处分布均与测试时分布(ρ=0)不同,且通用课程缺乏最大化ρ=0训练的显式机制。我们在§3.2(https://arxiv.org/html/2609.13997#S3.SS2)中形式化该分布偏移代价,并提出*单调前沿课程*,该方法维持样本级单调非递增引导前沿,持续优于现有课程。

我们的贡献包括:
- • 证明教师引导课程学习可解锁RLVR的不可解问题。在128个此类问题上的训练数据效率达到或超过在2000个混合难度问题上的GRPO。
- • 表明该范式*扩展推理边界*(pass@k在所有k直至256时提升),与先前观察到的RLVR缩小覆盖范围形成对比Yue et al. (2025) (https://arxiv.org/html/2609.13997#bib.bib14)。
- • 提出*单调前沿课程*,专为纯不可解情境设计,通过样本级单调前沿最大化无引导训练,持续优于现有课程。

## 2 不可解情境
我们首先确立研究的实证基础:形式化问题在RLVR下*不可解*的含义(§2.1),验证此类问题在训练中大多保持无效(§2.2),并证明教师引导可将其解锁为丰富的学习信号源(§2.3)。

### 2.1 不可解问题与消失的梯度信号
GRPO Shao et al. (2024) (https://arxiv.org/html/2609.13997#bib.bib3) 通过为每个提示采样n条推理路径并计算组相对优势Ai=(ri−μg)/(σg+ε)训练策略πθ。当所有推理路径返回相同奖励时,σg=0,所有优势值消失,不产生梯度。对于二元奖励,每当组内完全正确或完全错误时即发生此情况。

###### 定义1(不可解问题)
对于策略π0和采样预算N,问题s是*N-不可解*的,若pass@N(π0,s)=0,即在N次独立推理中未找到正确解。预算N应相对于GRPO每提示推理数n足够大,以确保N-不可解性能可靠预测每个训练组内的均匀失败。我们使用n=8(每组8条推理)并设置N=64:在64次尝试中无成功的问题在几乎每个训练步骤都极可能产生n=8次失败。从我们的2000问题竞赛数学语料库(附录C详情)中,约7%的问题(共147个)对Qwen3-1.7B是64-不可解的。这些问题可能标示着模型的推理边界,但在GRPO下贡献的梯度信号可忽略不计。

### 2.2 浪费假设
可能预期训练将逐渐使某些不可解问题变得有效,从而开始产生学习信号。我们通过追踪在Qwen3-1.7B上1200步GRPO基线(§4所述相同运行)的所有检查点中147个不可解问题的pass@8来验证此点。

图2:初始不可解问题(pass@64=0)在GRPO训练检查点上的平均pass@8

如图2所示,pass@8在300-400步时上升至约24%后趋于平台;在1200步时,超过75%的初始不可解问题仍产生零成功。变得可学习的极小部分主要可通过训练期间模型的适度能力增长来解释。这证实了*浪费假设*:在GRPO下,绝大多数不可解问题在整个训练过程中被*结构性排除*于学习之外。

### 2.3 通过教师引导解锁
若瓶颈在于均匀失败,自然补救措施是降低有效难度使部分成功。我们采用DeepSeek-V3.2 DeepSeek-AI et al. (2025b) (https://arxiv.org/html/2609.13997#bib.bib31); DeepSeek-AI et al. (2025a) (https://arxiv.org/html/2609.13997#bib.bib43) 作为本文的教师模型;对于每个不可解问题s,提示教师模型生成包含离散步骤的结构化推理轨迹T(s)(附录G详情)。*引导级别*ρ∈[0,1]控制向学生揭示该轨迹的比例。令nsteps(s)表示T(s)中的步骤数,我们暴露前g步:

g=round(ρ⋅nsteps(s))  (1)
sρ=s∪{T(s)的前g步}

学生接收增强提示sρ,其中教师的部分轨迹作为辅助上下文("提示")呈现,然后从头生成完整解决方案(模板见附录G)。

表1:Qwen3-1.7B在147个不可解问题上不同引导级别ρ下的pass@8(4次独立评估平均值)

曲线急剧上升。pass@8从ρ=0时的2.2%增至ρ=0.25时的34.0%和ρ=1时的85.4%,在ρ∈[0.25,1]区间存在宽广可学习带。2.2%的残余值意味着单个问题成功概率小但不严格为零,这仍与有限样本pass@64=0筛选一致。教师引导将原本无效群体转化为每一步都产生非平凡优势的群体,这是*解锁*的操作含义。因此每个不可解问题成为由ρ索引的*训练状态族*,自然暗示*后链式课程*:从高ρ(学生可靠成功)开始,逐步撤除引导至ρ=0(学生必须完全独立解题)。我们在下一节形式化该范式。

## 3 不可解问题的课程方法
### 3.1 后链式家族
若课程在ρ>0处放置非平凡训练质量并逐步将该质量移向ρ=0,则为*后链式*课程。三个典型子家族占据此设计空间。

#### 分阶段课程
分阶段课程维持单一全局调度ρglobal(t),当聚合成功阈值满足时推进Salimans and Chen (2018) (https://arxiv.org/html/2609.13997#bib.bib22)。实践中,课程性能由调度器设计主导,对于何时及如何推进全局ρ无公认最佳实践。简单分阶段反向课程在阶段转换时可能出现急剧下降及早期阶段技能退化Xi et al. (2024) (https://arxiv.org/html/2609.13997#bib.bib17)。因此对于§4实验我们不包含分阶段基线。

#### 混合课程
混合课程通过扩展每样本状态空间绕过调度器:每个问题在M个离散化ρ级别上复制,单次训练遍历均匀采样所有级别。对于§4实验我们使用R3 Xi et al. (2024) (https://arxiv.org/html/2609.13997#bib.bib17) 作为混合基线(M=5级别:ρ∈{0,0.25,0.5,0.75,1}),将128个不可解问题扩展为640行数据集并使用标准GRPO训练。

#### 样本级自适应课程
样本级自适应课程为每个样本维护一个调度并根据推理结果更新。参考实例是AdaBack Amani et al. (2026) (https://arxiv.org/html/2609.13997#bib.bib18),一种样本级自适应方法,我们将在下文与R3式混合课程比较。最初针对连续引导

相似文章

锁入口,内开阔:RLVR 如何缩窄解空间

arXiv cs.LG

本文通过分析多样性在何处丧失,研究了带有可验证奖励的强化学习如何缩窄大语言模型推理的解空间,发现其集中于轨迹的“入口”处。研究证明,无需牺牲准确性,即可通过干预措施恢复解的广度。

通用推理的可迁移性:多领域RLVR的自动化课程设计

Hugging Face Daily Papers

本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。