选择多样化SFT轨迹提升后RL泛化能力

Hugging Face Daily Papers 论文

摘要

本文提出一种轻量级的、基于规则的多样化SFT轨迹选择器,以提升推理模型在后RL阶段的泛化能力,并在数学基准测试中展示了显著的性能提升。

经验证的解决方案在为推理模型准备强化学习(RL)时并非同样有用。我们全面研究了路径多样性,即监督微调(SFT)数据中推理步骤序列的变化,并提出一种轻量级的、基于规则的指纹来选择它。在相同预算和资源池中,使用匹配的训练配方和检查点,选择多样化而非相似的路径,可以提升后RL阶段在谜题和数学问题上的覆盖范围,包括处理比两个训练阶段所见更难的问题。在合成实验中,路径多样化的SFT将OLMo3-7B的pass@8在未用于SFT的环境中提升了16.9个百分点。在单一模型条件下,当一个模型生成所有候选项时,多样化选择在10个数学基准测试中将平均pass@8提升了最多6.2个百分点。前RL诊断分析表明原因:多样化的SFT即使在平均准确率略低的情况下,也能在更多提示上产生成功和失败的尝试,从而为相对组的RL提供具有学习信号的更多提示。在3个开源语料库上,我们仅使用CPU的选择器,无需模型调用,在所有平均后RL性能比较中都优于更昂贵的替代方案。这些结果将推理路径多样性确定为一个实用的标准,用于选择能更好地为模型准备RL的SFT数据。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:23

论文页面 - 选择多样化的SFT轨迹可提升RL后的泛化能力

来源:https://huggingface.co/papers/2609.33780 发布于 9月27日

·

由用户提交:https://huggingface.co/shizhuo2

Dylan (https://huggingface.co/shizhuo2) 于9月29日

摘要

经过验证的解决方案在为推理模型准备强化学习时并非同等有效。我们对路径多样性——即监督微调数据中推理步骤序列的变异——进行了全面研究,并提出了一种轻量级、基于规则的指纹方法来筛选多样性。在相同预算下,从同一资源池中选择多样而非相似的路径,能在谜题和数学问题中提升RL后的解题覆盖范围,包括处理比两个训练阶段所见更难的合成实验问题。在路径多样化的SFT中,OLMo3-7B在SFT阶段留出环境上的pass@8指标提升了16.9个百分点。在单一模型条件下(即一个模型生成所有候选答案),多样化选择在10个数学基准测试中平均pass@8提升了最多6.2分。RL前的诊断分析表明了原因:尽管平均准确率略低,多样化的SFT能在更多提示上同时产生成功与失败的尝试,从而为分组相对RL提供更多具有学习信号的提示。在三个开源语料库上,我们仅使用CPU的选择器无需模型调用,在所有平均RL后性能的比较中均优于更昂贵的替代方案。这些结果确认推理路径多样性作为筛选SFT数据的实用标准,能更好地为模型适应RL做好准备。

查看arXiv页面 (https://arxiv.org/abs/2609.33780)查看PDF (https://arxiv.org/pdf/2609.33780)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33780)

通过智能体获取本文:

hf papers read 2609\.33780

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型的README.md中引用 arxiv.org/abs/2609.33780 以从此页面链接到该模型。

引用本文的数据集0

无数据集链接本文

在数据集的README.md中引用 arxiv.org/abs/2609.33780 以从此页面链接到该数据集。

引用本文的Spaces0

无Space链接本文

在Space的README.md中引用 arxiv.org/abs/2609.33780 以从此页面链接到该Space。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。

相似文章

学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集

arXiv cs.CL

本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。

论SFT的泛化:强化学习视角与奖励修正

Papers with Code Trending

本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。

@Orange41324306:TailRL 与 TailSFT

X AI KOLs Timeline

Sadhika Malladi 提出 TailSFT,这是一种轻量级且原则性的方法,旨在改善覆盖范围并提升RL后性能,基于先前的研究,该研究批评了xent SFT用于准备RL。