@SergioPaniego: https://x.com/SergioPaniego/status/2074863503312044499
摘要
一篇关于2026年前沿AI模型如何利用蒸馏技术的文章,涵盖离策略、在策略和自蒸馏阶段,并以Gemma、DeepSeek、GLM、Nemotron和Qwen3为例。
查看缓存全文
缓存时间: 2026/07/09 19:51
2026年(到目前为止)的蒸馏:哪些前沿模型在使用以及如何使用
本文是 Ben 和我正在制作的《训练一个智能体》系列课程第2课“蒸馏”的补充材料。这门课逐步教授编码智能体背后的后训练技术。第1课涵盖了轨迹上的 SFT。
本文也与我们在课前发布的蒸馏简史相配合,如果你想先了解背景信息的话。
蒸馏在 2026 年前沿模型的后训练方案中得到了广泛应用。我们在直播课中讨论的三个阶段(离线策略、在线策略和自蒸馏)直接对应了各实验室在实际中如何使用蒸馏。
一个大教师和一个小学生
最原始的应用仍然随处可见!用一个又大又昂贵的教师来训练一个更小的学生,使其与教师匹配。
Gemma 3 的技术报告告诉我们,其后训练“依赖于来自大型 IT(指令微调)教师的知识蒸馏的改进版本”。全新的 Gemma 4 技术报告描述了类似的后训练方案,因此我们可以推断其中也涉及了一些蒸馏。DeepSeek-R1-Distill 也是这种情况的一个例子,我们在简史文章中已经提到过:通过简单的微调(SFT)在教师的文本上(序列级别的形式),将 R1 的推理轨迹蒸馏到紧凑的 Qwen 和 Llama 学生模型中。
这正是我们在课堂上讲到的离线策略阶段的两种形式:匹配教师的下一词元分布(软标签,白盒)或直接在教师生成的文本上训练(硬标签,黑盒有效)。R1-Distill 属于第二种。相同的师生思想,不同的信号。
将 RL 专家合并到一个模型中
较新的用法有所不同,这也是今年大多数前沿实验室趋同的方向。通过强化学习让单个模型在所有方面都表现出色,结果证明非常复杂,因为在一个训练阶段获得的技能往往会在下一个阶段退化。大多数实验室找到的解决方法是:为每个领域训练一个单独的 RL 专家(数学、代码、智能体任务各一个),然后在学生生成自己的 rollout 时将所有这些专家蒸馏到同一个学生中。这就是在线策略蒸馏:学生写,教师评——每个词元都如此。
我在阅读这些报告时注意到一个有趣的现象:这里的教师通常不是更大的模型。它们是相同基础模型、相同规模的检查点,只不过每个检查点通过 RL 在单个领域上推得更远。使它们成为好教师的是专业化而非规模。
-
DeepSeek-V4 最清晰地描述了这条流水线。每个领域都有自己的专家(SFT,然后 GRPO),之后“通过在线策略蒸馏训练一个统一的模型”,学生对专业化教师优化反向 KL 损失。
-
多教师形式的名字来自 MiMo-V2-Flash:MOPD(多教师在线策略蒸馏),后来在其自己的论文中进行了研究。领域教师根据学生生成的任何内容提供密集的、词元级别的信号。
-
GLM-5,即 GLM-5.x 家族背后的报告,将其应用于训练阶段之间而非领域之间。在其顺序 RL 阶段之后,一次最终的蒸馏传递恢复了沿途退化的能力,教师是同一条线上更早的检查点。离模型自我教学只有一步之遥。
-
Nemotron 3 Ultra,NVIDIA 的旗舰模型,大规模采用了多教师形式:超过十个专业教师,每个都有自己的领域流水线,在学生自己的 rollout 上提供密集的词元级指导。
-
Qwen3 在经典方向(大教师、小学生)上使用了相同的机制,学生生成并对齐其 logits 到教师。他们的报告称,其成本大约是 RL 的 1/10 GPU 小时,且结果更好。
每个实验室都使用相同的理由来证明这一点。教师可以针对学生产生的每一个词元提供反馈,而 RL 中的奖励是针对整个尝试的一个数字(我们在课堂上解释过这一点)。因此,蒸馏在收敛到学生需要修复的确切行为上要快得多。Thinking Machines 关于在线策略蒸馏的文章是我读过的关于这一论点最清晰的实践者版本,并附有数据,以一小部分计算量匹配了他们的 RL 基线。
当教师就是你
第三种用法完全抛弃了单独的教师。
Cursor 的 Composer 2.5 使用自蒸馏进行训练。它们向上下文中注入一个提示,描述所需的行为,带有提示的模型成为同一模型无提示版本的教师。一个逐词元的 KL 散度将无提示的策略推向有提示的自己,因此模型在推理时最终产生该行为而不需要提示。这就是我们在直播课中提到的“特权教师”。Cursor 的 Sasha Rush(@srush_nlp)在 Dwarkesh Patel 的这个片段中详细解释了它(类比中出现了拉法·纳达尔,仅凭这一点就值得观看)。
Thinking Machines 展示了另一个自教师,使用与上一节相同的在线策略方案,只交换了教师。在新领域数据上微调后,他们从微调前的检查点进行蒸馏,以恢复微调擦除的行为,同时保留新知识。用课堂术语来说,这是更早的教师。这是他们针对持续学习的提议,让已部署的模型能够学习新东西而不忘记旧的。注意,这与 GLM-5 在 RL 阶段之间解决的问题相同,只是在个人规模上。
教师不需要更大,只需要在上下文中更好。有时,它就是模型本身。
要点
这就是目前为止蒸馏在 2026 年的状况。它将大模型压缩成小模型,它将 RL 专家合并成一个模型,它还让模型从自己的更好版本中学习。不过,在这些名称之下,它们都是一个师生机制的变体,在 TRL 中以你可复现的规模开放(课堂上的所有内容)。
如果你想看看这一切实际上是如何运作的,去观看课程吧。
本系列还将有更多课程。关注 Ben 和我来获取下一节课的信息。
相似文章
@SergioPaniego: 前沿模型在后训练流程中使用蒸馏!到2026年,蒸馏有三个作用:- 将大模型压缩成小模型…
解释了前沿模型后训练流程中蒸馏的三种用途:将大模型压缩成小模型、合并强化学习专家、以及自我学习。还包括一篇详细说明每个方法对应哪些模型的文章。
@SergioPaniego: 在模型蒸馏成为攻击向量之前,它确实是一种在你关心的任务上提升模型性能的便捷方法……
本文简要介绍了AI中模型蒸馏的历史,并预告了即将举行的一场关于使用TRL(Transformer强化学习)蒸馏开放模型的直播课程。
@neural_avb: 有一篇关于On-Policy Distillation的绝佳文章。几个月前出现在HF上。
一条推荐关于On-Policy Distillation文章的推文,该文章发表在Hugging Face上。
@NielsRogge: 当前AI领域最热门的术语之一是"On-policy distillation"。这是一种后训练技术,其中学生模型…
On-policy distillation被强调为一种热门后训练技术,结合了蒸馏和在线RL,现已列入PapersWithCode,有183篇引用论文。
@zhaisf: 这是 @geoffreyhinton 提出的蒸馏方法的一些神奇结果,当我第一次看到它们时,真的让我震惊,而且……
本文讨论了模型蒸馏对训练分布的惊人鲁棒性,即使与目标分布的重叠很小,以及其对在线/离线策略蒸馏的影响。