学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集

arXiv cs.CL 论文

摘要

本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。

arXiv:2606.04466v1 公告类型:新论文 **摘要:** 针对推理任务的小语言模型(SLM)后训练通常遵循SFT-then-RL流程,但现有工作鲜少考虑每个阶段应该学习什么数据。我们认为,数据策略应与SFT和RL各自的不同角色相匹配:SFT更适合习得模型尚未掌握的推理技能,而RL则更适合巩固模型已能部分运用的技能。基于这一原则,我们提出了一种难度感知的SFT-then-RL框架,将训练数据组织为各阶段专属的数据集。针对SFT阶段的困难样本,我们引入了Bridge机制,将教师模型生成的原始推理轨迹转化为对SLM更易学习的监督信号。针对RL阶段仍未解决的困难样本,我们应用Critique Fine-Tuning,将全零奖励的失败案例转化为诊断、修复和新推理轨迹监督信号,用于下一轮SFT阶段。在两个SLM上跨五个推理基准的实验表明,我们的方法相比代表性的SFT、知识蒸馏和RL基线均取得了一致性提升。我们的结果强调了在SFT与RL之间协调数据难度对于有效的SLM推理后训练的重要性。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:14

# 学习该学什么:面向小语言模型推理的SFT-then-RL阶段专属数据集

来源:https://arxiv.org/html/2606.04466

Chongyang He¹ Rui Zhang²¹¹脚注标记:1 Zixun Wang³ Xin Li⁴
¹清华大学 ²新加坡国立大学 ³滴滴 ⁴电子科技大学
hecy25@mails\.tsinghua\.edu\.cn

###### 摘要

对小语言模型(SLM)进行推理能力后训练通常遵循SFT-then-RL流程,然而现有工作鲜少考虑每个阶段应学习什么数据。我们认为,数据策略应与SFT和RL各自的不同角色相匹配:SFT更适合习得尚未掌握的推理技能,而RL更适合巩固模型已能部分触及的技能。基于这一原则,我们提出一个难度感知的SFT-then-RL框架,将训练数据组织为阶段专属集合。针对SFT阶段的难样本,我们引入Bridge机制,将教师模型原始生成的推理轨迹转化为更适合SLM学习的监督信号。针对RL阶段仍无法解决的难样本,我们应用Critique Fine-Tuning,将全零奖励失败案例转化为诊断、修复及新推理轨迹监督,用于下一轮SFT阶段。在两个SLM上跨五个推理基准的实验表明,我们的方法持续优于具有代表性的SFT、蒸馏和RL基线。我们的结果强调了在SFT和RL之间协调数据难度对于SLM推理后训练的重要性。

学习该学什么:面向小语言模型推理的SFT-then-RL阶段专属数据集

Chongyang He¹††感谢:同等贡献。††感谢:通讯作者。Rui Zhang²¹¹footnotemark:1 Zixun Wang³ Xin Li⁴
¹清华大学 ²新加坡国立大学 ³滴滴 ⁴电子科技大学
hecy25@mails\.tsinghua\.edu\.cn

## 1 引言

推理导向大语言模型(LLM)的兴起,如 DeepSeek-R1⁴ (https://arxiv.org/html/2606.04466#bib.bib2) 和 OpenAI o1 OpenAI et al.\(2026 (https://arxiv.org/html/2606.04466#bib.bib1)\),表明监督微调后接强化学习(SFT-then-RL)能够显著增强多步推理能力。小语言模型(SLM;参数量 $\leq$ 3B)在效率、成本和可及性方面具有互补优势,对资源受限的应用场景颇具吸引力。尽管近期研究已探索了面向SLM的推理蒸馏与后训练 Chen et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib3)\); Guan et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib4)\); Luo et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib5)\),一个基本问题仍未得到充分探索:**对于SLM,不同难度的推理数据应如何在SFT和RL阶段之间分配?**

先前工作 Guan et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib4)\) 表明,SFT-then-RL中的两个阶段承担不同的功能角色。SFT可视为**扩展(Extend)**阶段,其中CoT蒸馏通过引入来自更强教师模型的新推理模式来拓展模型的推理边界⁴ (https://arxiv.org/html/2606.04466#bib.bib2); M. Kim, A. Shrestha, S. Shrestha, A. Nepal, and K. Ross \(2025\) (https://arxiv.org/html/2606.04466#bib.bib9)。相比之下,带有可验证奖励的RL通常更多地被理解为**回忆(Recall)**阶段:它主要放大和优化模型已可访问的知识,而非灌输全新的能力 Shao et al.\(2024 (https://arxiv.org/html/2606.04466#bib.bib10)\); Yue et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib11)\)。这种阶段专属视角意味着:SFT应让SLM接触尚未完全掌握但仍可习得的推理技能,而RL应聚焦于模型已能以非零概率发现正确解的样本。

然而,将难推理数据直接迁移给SLM并非易事。近期研究表明,SLM往往难以从冗长复杂的教师生成CoT轨迹中学习,这一现象被称为**长CoT退化(Long CoT Degradation)** Luo et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib5)\)。在这种情况下,过于复杂的CoT监督可能导致SLM习得表面推理模式,而非稳健的解题技能 Li et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib7)\)。此外,LLM生成的推理链往往包含逻辑跳跃和冗余 Cai et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib12)\),进一步加剧了教师监督与SLM学习能力之间的不匹配。这些发现表明,关键挑战不仅在于是否应使用难样本,还在于如何对其进行转化并分配到不同的后训练阶段。

受此问题驱动,我们在GSM8K训练集上进行了受控实验,以考察样本难度如何影响SFT阶段的学习。在Qwen2.5-0.5B-Instruct和Llama3.2-1B-Instruct上,我们均观察到一致规律:在相同监督token预算下,Medium→Hard课程比在单一难度组或混合集上训练能获得更强的SFT后推理性能。我们采用pass@8作为评估SFT阶段的主要指标,因为先前工作 Kang et al.\(2025 (https://arxiv.org/html/2606.04466#bib.bib6)\) 表明,pass@$k$ 能更可靠地预测 **SFT-then-RL** 范式中RL后的下游性能。如图1 (https://arxiv.org/html/2606.04466#S1.F1) 所示,该结果表明中等难度样本提供了强有力的习得信号,而难样本仅在有可学的起点之后才能进一步发挥作用。本动机实验的详细设置见附录A (https://arxiv.org/html/2606.04466#A1)。

参见图注图1:Llama3.2-1B-Instruct上的难度感知SFT动机实验。在相同token预算下,Medium→Hard课程取得了最强的SFT后pass@8性能。

**重要的是,这一观察并不意味着难样本应被丢弃。** 难样本往往包含超出SLM当前能力的推理模式,因此对于拓展其推理边界颇具价值。问题在于,从更强LLM蒸馏得到的原始难样本往往过长、跳跃性过强,或局部难度过大,SLM难以直接吸收。因此,症结不在于难样本本身,而在于原始LLM生成的推理轨迹与SLM可学性之间的不匹配。

为应对这一挑战,我们提出一个围绕三个功能性数据集组织的难度感知SFT-then-RL框架。**习得集(Acquisition Set)** 用于初始SFT,由中等难度样本和经过Bridge调整的难样本构成。为使难样本对SLM可学,我们的 **Bridge** 机制从**重要性**、**跳跃性**和**难度**三个维度评估每个推理步骤,并应用保留、扩展、压缩、删除或局部化操作,将原始难推理轨迹转化为符合模型能力的监督信号。SFT之后,SLM仍会遇到无法解决的问题,若直接用于RL会导致奖励稀疏。因此,我们将**巩固集(Consolidation Set)**定义为所有非全零奖励样本。全零奖励样本被排除在直接RL之外,因为当前策略在推理预算内无法产生任何正确解。我们不采用在RL内部通过额外搜索或提示来处理这些失败的方式 Zhang et al.\(2025a (https://arxiv.org/html/2606.04466#bib.bib15)\),而是遵循阶段专属原则:SLM无法访问的技能应通过SFT来学习。因此,我们构建**回收集(Recycled Set)**,由更强的教师模型将全零失败案例转化为诊断、修复及新推理轨迹监督,反馈至下一轮SFT阶段。这形成了一个迭代循环:SFT拓展模型的推理边界,RL巩固部分可访问的技能。

我们的贡献总结如下:

- 我们揭示,将难样本转化为符合模型能力的监督信号并通过合适课程引入,可提供更强的SFT收益,从而将难数据转化为SLM有效的习得信号。
- 我们提出Bridge机制,通过步骤级重要性、跳跃性和难度估计,将难推理轨迹转化为符合模型能力的监督信号。
- 我们引入错误引导的回收机制,将全零奖励RL失败案例转化为SFT监督信号,并在两个SLM上跨域内和域外推理基准上验证了完整框架。

## 2 相关工作

### 2.1 SLM后训练范式

推理导向LLM,如 DeepSeek-R1\(⁴ (https://arxiv.org/html/2606.04466#bib.bib2)\) 和 OpenAI o1\(OpenAI et al.,2026 (https://arxiv.org/html/2606.04466#bib.bib1)\),已表明 **SFT-then-RL** 范式能有效提升多步推理能力。对于SLM,该范式通常依赖从更强教师模型蒸馏推理轨迹,再结合可验证信号进行基于奖励的优化\(Zhang et al.,2025b (https://arxiv.org/html/2606.04466#bib.bib33); Hu et al.,2026 (https://arxiv.org/html/2606.04466#bib.bib34)\)。近期工作进一步表明,SFT和RL承担不同功能角色:SFT可通过引入新模式拓展模型的推理边界,而RL主要回忆并强化模型已可访问的能力\(Guan et al.,2025 (https://arxiv.org/html/2606.04466#bib.bib4); Shao et al.,2024 (https://arxiv.org/html/2606.04466#bib.bib10); Yue et al.,2025 (https://arxiv.org/html/2606.04466#bib.bib11)\)。同时,pass@大$k$已被证明比贪心准确率更能预测下游RL潜力\(Kang et al.,2025 (https://arxiv.org/html/2606.04466#bib.bib6)\)。然而,现有研究主要关注训练算法 Zhang et al.\(2025a (https://arxiv.org/html/2606.04466#bib.bib15)\); Wang et al.\(2025d (https://arxiv.org/html/2606.04466#bib.bib32)\),对数据难度在各阶段的专属分配探索不足。

### 2.2 面向SLM的能力对齐监督

推理蒸馏的主要障碍是复杂LLM生成推理轨迹与SLM有限学习能力之间的不匹配。直接从冗长密集的教师轨迹中学习可能导致**长CoT退化**,使SLM无法内化稳健的推理模式\(Luo et al.,2025 (https://arxiv.org/html/2606.04466#bib.bib5); Li et al.,2025 (https://arxiv.org/html/2606.04466#bib.bib7)\)。为此,先前工作通过分块蒸馏\(Chen et al.,2025 (https://arxiv.org/html/2606.04466#bib.bib3)\)、批判-精炼\(Cai et al.,2025 (https://arxiv.org/html/2606.04466#bib.bib12)\)、问题空间映射\(Wang et al.,2025b (https://arxiv.org/html/2606.04466#bib.bib13)\)或选择性推理\(Wang et al.,2025a (https://arxiv.org/html/2606.04466#bib.bib14)\)等方式对推理监督进行重组或简化。针对RL阶段的失败,BREAD\(Zhang et al.,2025a (https://arxiv.org/html/2606.04466#bib.bib15)\)引入专家锚点以缓解奖励稀疏问题。尽管这些方法调整了推理监督或改善了RL探索,但它们主要孤立地优化SFT或RL某一阶段,仍缺乏一种协调的数据策略,能够联合考虑SLM在SFT阶段应习得什么、在RL阶段应巩固什么。

参见图注图2:所提难度感知SFT-then-RL框架概览。初始SFT阶段由中等样本和经过Bridge调整的难样本构建习得集。RL阶段在巩固集上训练,即为GRPO提供可用奖励信号的非全零样本。全零奖励失败案例通过教师引导的诊断、修复和新推理轨迹监督转化为回收集,反馈至下一轮SFT阶段,形成迭代式习得-巩固循环。

## 3 方法

我们为SLM数学推理开发了一个难度感知后训练流程。首先根据模型特定难度对训练样本进行划分,并由中等难度样本和经Bridge调整的难样本构建初始SFT课程。随后,对具有信息性奖励信号的样本执行RL,将全零奖励失败案例排除在直接策略优化之外。这些失败案例通过教师引导的诊断、修复和新推理轨迹监督回收至下一轮SFT阶段,形成迭代循环:SFT拓展缺失技能,RL巩固部分可访问技能。

### 3.1 阶段专属数据划分

给定训练数据集 $\mathcal{D}=\{(q_{j},a_{j}^{*})\}_{j=1}^{N}$,其中 $q_{j}$ 表示第 $j$ 个数学问题,$a_{j}^{*}$ 表示其真实答案,我们针对当前SLM $\pi_{\theta}$ 估计样本难度。对于每个问题 $q_{j}$,我们采样 $n$ 个回复:

$$\{o_{j,i}\}_{i=1}^{n}\sim\pi_{\theta}(\cdot\mid q_{j}).\tag{1}$$

每个回复由基于规则的验证器评估:

$$r_{j,i}=\mathbb{I}[\mathrm{Ans}(o_{j,i})=a_{j}^{*}],\tag{2}$$

其中 $\mathrm{Ans}(\cdot)$ 从回复中提取最终数值答案。随后计算经验正确率:

$$\rho(q_{j})=\frac{1}{n}\sum_{i=1}^{n}r_{j,i}.\tag{3}$$

在实验中,我们设置 $n=64$ 用于难度估计。基于 $\rho(q_{j})$,我们将训练样本划分为三个模型特定难度组:$\mathcal{D}_{simple}$ 包含 $\rho(q_{j})\in[0.75,1]$ 的样本,$\mathcal{D}_{medium}$ 包含 $\rho(q_{j})\in[0.25,0.75)$ 的样本,$\mathcal{D}_{hard}$ 包含 $\rho(q_{j})\in[0,0.25)$ 的样本。

我们的动机实验表明,由中到难的SFT课程为后续后训练提供了更强的初始化。然而,难样本的原始形式往往不适合SFT,因为教师蒸馏的推理轨迹可能冗长、抽象,SLM难以直接吸收。因此,我们应用基于Bridge的变换,将难样本转化为更可学的监督信号,详见第[3.2节 (https://arxiv.org/html/2606.04466#S3.SS2)]。

相应地,我们将数据组织为三个功能集。**习得集(Acquisition Set)** 用于初始SFT,由原始中等难度样本和经Bridge调整的难样本构成。**巩固集(Consolidation Set)** 用于RL,由非全零样本构成,包括提供显式奖励对比的混合奖励样本,以及稳定已可访问技能的全一奖励样本。受Critique Fine-Tuning(CFT)\(Wang et al., (https://arxiv.org/html/2606.04466#bib.bib36); Wang et al.,2025c (https://arxiv.org/html/2606.04466#bib.bib35)\) 启发,**回收集(Recycled Set)** 由不适合直接RL的全零奖励样本构成,这些样本被转化为错误引导的SFT监督信号。

该划分遵循阶段专属学习原则:SFT更适合习得缺失的推理技能,而RL更适合巩固模型已能部分访问的技能。

### 3.2 基于Bridge的初始SFT

基于Bridge的初始SFT的目标是使难样本对SLM可学,而无需强迫其直接模仿原始LLM蒸馏的推理轨迹。我们采用**先中等、再……**

相似文章

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。

从预训练到后训练的推理理解

arXiv cs.CL

本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。

理解从预训练到后训练的推理

Hugging Face Daily Papers

本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。

RASFT:面向推理的滚动自适应监督微调

arXiv cs.LG

RASFT是一种新颖的大型语言模型监督微调框架,它根据模型自身的推理能力调整专家监督,在数学和代码推理基准测试中相比标准SFT和强化学习方法取得了更好的性能。