选择多样化SFT轨迹提升后RL泛化能力
摘要
本文提出一种轻量级的、基于规则的多样化SFT轨迹选择器,以提升推理模型在后RL阶段的泛化能力,并在数学基准测试中展示了显著的性能提升。
查看缓存全文
缓存时间: 2026/09/30 04:23
论文页面 - 选择多样化的SFT轨迹可提升RL后的泛化能力
来源:https://huggingface.co/papers/2609.33780 发布于 9月27日
·
由用户提交:https://huggingface.co/shizhuo2
Dylan (https://huggingface.co/shizhuo2) 于9月29日
摘要
经过验证的解决方案在为推理模型准备强化学习时并非同等有效。我们对路径多样性——即监督微调数据中推理步骤序列的变异——进行了全面研究,并提出了一种轻量级、基于规则的指纹方法来筛选多样性。在相同预算下,从同一资源池中选择多样而非相似的路径,能在谜题和数学问题中提升RL后的解题覆盖范围,包括处理比两个训练阶段所见更难的合成实验问题。在路径多样化的SFT中,OLMo3-7B在SFT阶段留出环境上的pass@8指标提升了16.9个百分点。在单一模型条件下(即一个模型生成所有候选答案),多样化选择在10个数学基准测试中平均pass@8提升了最多6.2分。RL前的诊断分析表明了原因:尽管平均准确率略低,多样化的SFT能在更多提示上同时产生成功与失败的尝试,从而为分组相对RL提供更多具有学习信号的提示。在三个开源语料库上,我们仅使用CPU的选择器无需模型调用,在所有平均RL后性能的比较中均优于更昂贵的替代方案。这些结果确认推理路径多样性作为筛选SFT数据的实用标准,能更好地为模型适应RL做好准备。
查看arXiv页面 (https://arxiv.org/abs/2609.33780)查看PDF (https://arxiv.org/pdf/2609.33780)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33780)
通过智能体获取本文:
hf papers read 2609\.33780
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型的README.md中引用 arxiv.org/abs/2609.33780 以从此页面链接到该模型。
引用本文的数据集0
无数据集链接本文
在数据集的README.md中引用 arxiv.org/abs/2609.33780 以从此页面链接到该数据集。
引用本文的Spaces0
无Space链接本文
在Space的README.md中引用 arxiv.org/abs/2609.33780 以从此页面链接到该Space。
包含本文的收藏0
无收藏包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。
相似文章
Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.
学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集
本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。
论SFT的泛化:强化学习视角与奖励修正
本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。
跨对齐训练、模型生物和玩具模型的共享SFT经验
本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。
@Orange41324306:TailRL 与 TailSFT
Sadhika Malladi 提出 TailSFT,这是一种轻量级且原则性的方法,旨在改善覆盖范围并提升RL后性能,基于先前的研究,该研究批评了xent SFT用于准备RL。