@ziv_ravid: 1/我阅读了Nemotron 3 Ultra报告,将其后训练与DeepSeek V4的对比很有趣。两者现在都…

X AI KOLs Timeline 新闻

摘要

这条推文比较了Nemotron 3 Ultra和DeepSeek V4的后训练方法,指出两者都使用多个专长教师并通过在线策略蒸馏合并到一个学生模型,但在支持重叠方面存在差异。

1/我阅读了Nemotron 3 Ultra报告,将其后训练与DeepSeek V4的对比很有趣。两者现在都做同样的事:训练10多个专长教师,然后通过在线策略蒸馏合并到一个学生模型。真正区分它们的是支持重叠 🧵
查看原文
查看缓存全文

缓存时间: 2026/06/16 01:14

1/ 我读了一下 Nemotron 3 Ultra 的报告,对比他们的后训练和 DeepSeek V4 很有意思。两者现在做的是同一件事:训练 10 多个专精教师模型,然后用在线策略蒸馏(on-policy distillation)把它们合并成一个学生模型。真正将它们区分开的是支持集重叠(support overlap)。

2/ 在线策略蒸馏会为学生模型自身生成的结果打分。教师模型为学生生成的轨迹打分。这种方法只有在学生模型的输出落在教师模型的支持集(support)内时才有效。

3/ DeepSeek V4 天然就能做到这一点。教师模型是从同一个基座衍生出来的分支,每个分支加上领域 SFT 和 RL,学生模型就是从这些相同的分支蒸馏出来的。每个模型相对于同一骨干网络都是微小的扰动,所以学生模型的输出天然就在教师模型的分布内。

4/ Nvidia Ultra 却不然。它的教师模型的技能来自 SFT,而 SFT 的数据是由学生模型从未见过的外部模型(V4-Pro、gpt-oss、GLM)生成的。这导致每个教师模型的分布偏离学生模型的分布,因此学生模型的输出可能超出教师模型的分布范围。

5/ 这就是为什么 Ultra 在蒸馏前需要一个“预热”SFT 来把学生模型拉到教师模型的支持集内,而 V4 不需要。

6/ 这同样决定了损失函数的选择。V4 在每个 token 上匹配完整的教师分布。在他们的报告中,Ultra 尝试了 top-k 和全词汇表两种方式,发现它们比仅对采样到的 token 打分效果更差,尤其是在代理型任务上(这会放大噪声)。

7/ 换句话说:V4 认为仅对采样 token 打分不足以承载合并,而 Ultra 认为全词汇表打分比仅对采样 token 更差。当重叠度高时,稠密损失安全且有用;当重叠度低时,它会带来伤害。

8/ 这一点在它们的强化学习上也能看出。V4 完全放弃了学生模型的 RL,因为共同的血统已经保证了输出落在支持集内。而 Ultra 保留了统一的 RLVR,部分原因是为了让学生模型采样出更强的输出,使其更接近教师模型的支持集。

(在我看来)有趣的问题是:我们能否通过工程手段实现足够高的重叠,从而省去学生模型的 RL,还是说保留 RL 更有价值。我的猜测是,我们可以在不保留 RL 的情况下做到这一点。

相似文章

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。

@nrehiew_: 给视觉学习者

X AI KOLs Timeline

一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。

deepseek-ai/DeepSeek-V4-Pro

Hugging Face Models Trending

DeepSeek 发布了 V4-Pro 和 V4-Flash,这些混合专家模型采用混合注意力机制和 Muon 优化器,支持百万 token 级上下文。