NebulaExp-8B:基于全尺度消融研究的经验性后训练流水线

arXiv cs.AI 论文

摘要

本文介绍了NebulaExp,一种针对8B规模大语言模型的透明消融驱动后训练流水线,涵盖SFT、GRPO强化学习和多教师蒸馏。它识别了数学推理与代码生成之间的关键权衡,并表明数据正确性过滤是一阶优化因素。

arXiv:2606.26671v1 公告类型:新提交\n摘要:后训练对齐决定了大型语言模型的推理能力和遵循人类偏好的能力,然而现有工作大多隐瞒了详细的数据构建、过滤规则和训练方法,这阻碍了社区的可复现性和轻量级模型优化。本工作提出了NebulaExp,一个完全透明、基于消融研究的后训练流水线,基于Qwen3-8B-base构建,涵盖两个正交的模型分支:通用指令模型和复杂推理专用模型。我们整理了一个包含384万条多来源SFT样本的原始语料库和一个20万条可验证的RL候选池,并设计了一个端到端的数据处理堆栈,包括响应蒸馏、多维交叉验证过滤、细粒度难度分级、任务分类和多样性感知采样。对于指令分支,我们的三阶段优化监督微调方法NebulaExp-Ins-SFT将平均基准分数从Qwen3-8B-nothink的55.01提升到60.99。接着,GRPO强化学习进一步将平均分数提升到61.85。对于推理分支,中等难度的GRPO RL将平均推理分数从73.88提升到75.17。为了解决RL对任务验证器的依赖,我们系统性地研究了单教师和多教师OPD(MOPD):仅使用4000条指令遵循样本,就在IFEval上比RL基线高出3.26分,且平均总体提升+4.43;MOPD融合了四个领域专家教师,仅用1万条样本,就在基础模型上提升了平均性能4.18。本报告为8B规模大语言模型提供了一个完全可复现的经验性后训练配方,并全面剖析了指令遵循、数学推理、代码生成和通用知识之间的能力权衡。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:15

# NebulaExp-8B:基于全规模消融研究的经验性后训练流程

**来源:** https://arxiv.org/html/2606.26671

###### 摘要

后训练对齐决定了大型语言模型遵循人类偏好和进行推理的能力,然而现有工作大多未公开详细的数据构建、过滤规则和训练方法,这阻碍了社区的可复现性和轻量级模型的优化。本文介绍了NebulaExp,一个完全透明、基于消融实验驱动的后训练流程,该流程基于Qwen3-8B-base构建,涵盖两个正交的模型分支:通用指令模型和复杂推理专用模型。我们整理了一个包含384万条多来源SFT样本的原始语料库和一个20万条可验证的RL候选池,并设计了一个端到端的数据处理栈,包括响应蒸馏、多维交叉验证过滤、细粒度难度分级、任务分类和多样性感知采样。我们对SFT、GRPO强化学习(RL)和在线策略蒸馏(OPD)模块进行了受控消融实验,以量化数据质量、领域混合比例、样本难度和教师选择的影响。对于指令分支,我们三阶段优化的监督微调方法NebulaExp-Ins-SFT将平均基准分数从Qwen3-8B-nothink基线的55.01提升至60.99。随后GRPO强化学习进一步将平均分数提升至61.85。我们通过实验确定了两项关键的权衡:数学推理和代码生成需要相反的数据分布偏好,而长篇幅通用文本能为形式逻辑推理带来跨领域增益。对于推理分支,中等难度的GRPO RL将平均推理分数从73.88提升至75.17。为了解决RL对任务验证器的依赖,我们系统地研究了单教师和多教师OPD(MOPD):仅使用4000条指令遵循样本,就在IFEval上超越RL基线3.26分,平均整体提升+4.43分;MOPD融合了四位领域专家教师,仅使用1万条样本,平均性能比基础模型提升4.18分。值得注意的是,跨教师知识重组使得学生模型在数学推理基准上能够超越单个教师的上限性能。我们的核心发现表明,数据正确性过滤是首要的优化因素,而教师分布的兼容性比模型规模对蒸馏更为重要。本报告为8B规模LLM提供了一个完全可复现的经验性后训练方案,并全面剖析了指令遵循、数学推理、代码生成和通用知识能力之间的权衡。

## 一、引言

后训练是大语言模型在预训练之后的关键阶段,专注于人类价值对齐、可用性提升和安全性增强。在近期前沿模型家族,如GPT[29](https://arxiv.org/html/2606.26671#bib.bib36)、GLM[37](https://arxiv.org/html/2606.26671#bib.bib54)、DeepSeek[8](https://arxiv.org/html/2606.26671#bib.bib2)和Llama[1](https://arxiv.org/html/2606.26671#bib.bib55)中,对对齐数据、推理数据、强化学习和安全评估的日益重视表明,未来大模型的竞争将不仅取决于预训练规模,更取决于语料质量和后训练反馈循环的效率。因此,我们聚焦于后训练阶段,并围绕三个紧密相关的组成部分组织讨论:评估、语料构建和训练方法。

在模型训练的初始阶段,选择高质量的评估基准至关重要。一个可靠的评估框架也必不可少,因为模型能力体现在多个维度,而非单一指标。因此,评估通常借鉴多个公开且权威的基准测试,涵盖指令遵循、代码生成、数学推理、科学问题解决、常识推理和逻辑演绎。早期研究广泛使用经典基准,包括MMLU[14](https://arxiv.org/html/2606.26671#bib.bib38)、GSM8K[7](https://arxiv.org/html/2606.26671#bib.bib39)和HumanEval[6](https://arxiv.org/html/2606.26671#bib.bib40)。随着模型能力的不断提升,评估范式逐渐转向更困难、更专业的领域基准。因此,最近的评估越来越多地包含诸如IFEval[39](https://arxiv.org/html/2606.26671#bib.bib25)、LiveCodeBench[17](https://arxiv.org/html/2606.26671#bib.bib29)、Math-500[19](https://arxiv.org/html/2606.26671#bib.bib26)、AIME'25[3](https://arxiv.org/html/2606.26671#bib.bib44)、GPQA-Diamond[27](https://arxiv.org/html/2606.26671#bib.bib45)、MMLU-Redux[12](https://arxiv.org/html/2606.26671#bib.bib21)、AutoLogi[41](https://arxiv.org/html/2606.26671#bib.bib28)和ZebraLogic[20](https://arxiv.org/html/2606.26671#bib.bib27)等数据集。

虽然严格的评估基准能够准确量化性能,但模型性能的上限从根本上取决于训练数据的质量。语料构建是后训练的核心部分,因为模型只能从训练语料中学习到被表示的行为,并且在可能的情况下,需要可验证的监督来支持这些行为。由于开源语料库的可用性有限且质量参差不齐,语料构建已逐渐演变为一个以合成数据生成、正确性验证和推理对齐为中心的过程。在此过程中,通常会使用强大的教师模型,如DeepSeek-V4[8](https://arxiv.org/html/2606.26671#bib.bib2)、Qwen3.5[34](https://arxiv.org/html/2606.26671#bib.bib19)和GPT-5[29](https://arxiv.org/html/2606.26671#bib.bib36),来合成高质量样本。然而,数据生成后仍可能出现低质量案例。因此,原始数据必须经过一系列质量验证步骤,包括基于规则的过滤、基于模型的评分以及特定任务验证,如数学答案检查或代码执行测试[32](https://arxiv.org/html/2606.26671#bib.bib7)。最后,为了进一步提高数据质量,应用推理对齐以确保模型的内部逻辑和中间推理步骤一致且可解释,并由另一个评估模型来判断其质量。每一步都至关重要,过程中每个细节都直接影响最终语料库的质量。因此,如何构建数据处理流程已引起广泛的研究关注。

随着对模型能力和训练效率要求的日益增长,后训练范式也在不断改进。早期的后训练流程,如Qwen1[4](https://arxiv.org/html/2606.26671#bib.bib37),通常依赖监督微调(SFT)后接基于近端策略优化(PPO)的从人类反馈中学习强化学习。在这种设置中,SFT用于建立基本的指令遵循行为,而强化学习则借助单独训练的奖励模型进一步优化模型输出。尽管这种范式被证明是有效的,但它也引入了可观的人工标注、奖励建模、价值估计和强化学习优化成本。为了解决这个问题,DeepSeek-V2[21](https://arxiv.org/html/2606.26671#bib.bib49)在SFT之后采用GRPO,它不需要价值网络,并用分组相对比较取代了绝对价值估计。与此同时,Qwen2[36](https://arxiv.org/html/2606.26671#bib.bib50)使用直接偏好优化(DPO),直接优化偏好对,而无需显式训练奖励模型。随后,Qwen2.5[10](https://arxiv.org/html/2606.26671#bib.bib51)进一步将离线DPO与在线GRPO相结合,这表明了从静态偏好优化向混合离线-在线训练策略转变的总体趋势。

随着推理能力成为一个日益重要的目标,后训练方法进一步从通用对齐发展为面向推理的优化。DeepSeek-V3[22](https://arxiv.org/html/2606.26671#bib.bib52)继续采用监督微调和基于GRPO的训练策略,同时使用推理蒸馏来支持开发更强大的推理模型。DeepSeek-R1[13](https://arxiv.org/html/2606.26671#bib.bib53)提出了一个更系统的后训练方案,结合了冷启动数据、面向推理的强化学习、拒绝采样和通用强化学习,以激发长链推理行为。最近的模型通过多阶段强化学习、结果引导的偏好优化、智能体强化学习、真实环境交互、专家模型训练和在线策略蒸馏,进一步扩展了这一方向。这些发展表明,后训练范式和优化方法的选择已成为提升模型性能和训练效率的关键因素。

尽管语料构建和后训练算法取得了快速进展,但支配后训练性能的数据处理和训练方法的具体细节仍然不够透明。这种不透明性使得研究人员难以参考先前的工作并复现实验。为解决这一局限,我们引入了NebulaExp,一项完全基于Qwen3-8B-base[30](https://arxiv.org/html/2606.26671#bib.bib12)构建的开源后训练研究。NebulaExp不仅报告最终模型性能,还透明地呈现了整个后训练过程,包括数据来源、语料构建、训练方法、分阶段训练设计、中间结果、消融研究、经验观察和评估协议。我们首先专注于数据处理,它在决定后训练效果方面起着核心作用。NebulaExp展示了完整的语料构建过程,包括数据过滤、响应风格蒸馏、难度分级和多样性采样。在建立完整的数据处理流程后,我们进一步在不同训练阶段(包括监督微调、强化学习和OPD优化)进行并报告消融实验,以及在这些阶段中获得的经验观察。最终,在我们的评估框架下,训练后的NebulaExp模型在各自评估协议下,实现了比相应Qwen3-8B-nothink或Qwen3-8B-thinking基线更强的整体性能。这一结果表明,精心设计且透明的后训练流程可以在不修改基础模型架构的情况下大幅提升模型能力。最终,本文的核心贡献在于揭示后训练流程的内在机制和经验性权衡,而不仅仅是追求绝对的SOTA排行榜排名。具体而言,我们的工作贡献包括:

-   **构建了完整的后训练数据处理流程。** 该流程涵盖多来源数据收集、响应风格蒸馏、基于规则和基于模型的过滤、任务特定正确性验证、难度分级、分类和多样性感知采样。这些组件为从开源数据构建高质量SFT语料库提供了实用且可重用的工具。
-   **基于Qwen3-8B-base进行了一系列消融实验。** 特别是,我们研究了数据质量、样本难度、响应长度、课程设计和数据类型混合比例如何影响下游能力,并为选择和混合SFT语料库提供了参考策略。基于此训练方案,我们训练的模型在相应评估设置下,实现了比Qwen3-8B-nothink或Qwen3-8B-thinking更强的整体性能。
-   **基于SFT模型进行了强化学习(RL)消融实验,** 包括指令模型的RL算法消融和基于GRPO的中等难度推理模型RL实验。通过可验证的奖励公式和多配置RL调优,我们经验性地推导出一个实用的RL方案,以提升模型在推理、编码和指令遵循方面的性能。
-   **研究了在线策略蒸馏(OPD)作为无需验证器的后训练范式,** 涵盖了单教师和多教师OPD(MOPD)设置。仅用4000条IF样本,单教师OPD在IFEval上超越RL基线高达3.26分,并将通用能力平均分提升高达4.43分。在多教师设置中,MOPD仅通过1万条样本融合四位领域专家教师成一个统一模型,相比基础模型实现了4.18分的平均提升,并且通过跨教师知识重组,学生模型在数学推理上超越了单个教师的上限。

我们按如下方式组织本报告的其余部分。第II节(https://arxiv.org/html/2606.26671#S2)详细介绍了SFT和RL阶段所用数据的语料来源和预处理流程。遵循此流程,我们整理了384万个原始SFT样本,并构建了一个包含20万个可验证多领域RL候选池,从中抽取较小的过滤子集用于实际的RL实验。第III节(https://arxiv.org/html/2606.26671#S3)建立了评估框架,涵盖了通用知识、对齐度、数学推理和编码方面的基准选择,以及所有实验中使用的统一评估协议。第IV节(https://arxiv.org/html/2606.26671#S4)介绍了指令模型SFT和RL模块的消融研究,并总结了实验得出的实用训练见解。第V节(https://arxiv.org/html/2606.26671#S5)介绍了推理模型SFT、RL和OPD模块的消融研究,并据此总结我们的关键发现。最后,第VI节(https://arxiv.org/html/2606.26671#S6)总结研究发现、进行更广泛的讨论并指出当前工作的局限性。

## 二、数据整理

### II-A SFT数据整理

我们从公开可用的数据集中整理了一个包含384万个样本的语料库,来源包括Nemotron-cascade[32](https://arxiv.org/html/2606.26671#bib.bib7)、ODA-math-460K[11](https://arxiv.org/html/2606.26671#bib.bib8)、Nemotron-Math-V2[9](https://arxiv.org/html/2606.26671#bib.bib9)、OmniThought-Math[5](https://arxiv.org/html/2606.26671#bib.bib10)、AM-Thinking[31](https://arxiv.org/html/2606.26671#bib.bib11)、OpenScienceReasoning和Dolci-Instruct-SFT[23](https://arxiv.org/html/2606.26671#bib.bib15)。该语料库涵盖指令遵循、数学、代码、知识应用、通用STEM问题和日常对话。参见图注\(\(a\)\)思维数据分布。参见图注\(\(b\)\)指令数据分布。图1:SFT数据分布,包括数据来源和任务类型。从公开数据集中收集样本扩大了训练样本的数量。然而,直接组合这些语料库会带来几个挑战。响应风格不一致:由于原始数据由不同的大模型蒸馏得到,样本间的对话逻辑、响应范式、语言风格和内容结构差异很大。响应质量也参差不齐:许多

相似文章

ExpRL:面向LLM中期训练的探索式强化学习

Hugging Face Daily Papers

ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。

预训练期间的RL探索:重新审视LLM训练的策略优化

arXiv cs.LG

哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。