@liumengxinfly: 看到 Redis 的作者 X 上发声,说总有人反复说中国的模型是蒸馏出来的,是根本不懂机器学习。 之前看到有人说中国的模型是蒸馏出来的我还都会辩驳一番,后来实在是见到太多了,累了不想说了,干脆写出来算了。 很多人说蒸馏其实根本不知道蒸馏是…
摘要
本文详细解释了机器学习中知识蒸馏的技术原理,指出仅靠收集ChatGPT/Claude的输出对话无法实现有效蒸馏,因为缺少概率分布信息,并讨论了SFT和预训练中使用生成数据的局限性。
查看缓存全文
缓存时间: 2026/06/17 03:46
看到 Redis 的作者 X 上发声,说总有人反复说中国的模型是蒸馏出来的,是根本不懂机器学习。
之前看到有人说中国的模型是蒸馏出来的我还都会辩驳一番,后来实在是见到太多了,累了不想说了,干脆写出来算了。
很多人说蒸馏其实根本不知道蒸馏是什么,他们背后的意思可能是收集了大量的 Claude/ChatGPT 的对话就能让自己的模型能力也变成和 Claude/ChatGPT 一样,但根本没考虑技术上的可行性。
举个图像识别的例子,如果有一个模型可以识别动物,我想把它蒸馏到我自己的模型。如果我只是拿图片和老师模型分类结果给到学生模型,那这个蒸馏毫无意义。因为这和我直接拿标注好的样本进行训练没有区别,甚至标注结果比老师模型更准确,用老师模型的结果反而会降低准确性。
如果老师模型的分类结果对蒸馏没有意义,那什么对蒸馏有意义?有意义的是最终结果前一层各个分类的权重。例如分类识别结果是猫,那前一层可能是猫的概率 80%,老虎概率 5%,豹子概率 7%,狗概率 0% …,这一层其实才是模型的预测概率分布,是学生模型要学的。因为这里面比最后一个单一的结果包含了更多的隐含信息,比如猫和豹子更像,和狗更不像,这个更接近真实世界的概率分布。
在 LLM 里也是类似的,看似 LLM 是生成下一个 Token,其实生成的是下一个 Token 的一个概率分布。本质上 LLM 的参数是固定的,那么同样的输入,对应输出也是固定的。现在之所以每次对话生成都不一样,是因为在输出的时候并不是选择概率最大的那个 Token,而是在一定概率范围内随机挑一个 Token 导致的输出随机性。这也就是 Temperature, Top-k 这些参数干的事情,调整最后的概率分布,增加输出的随机性。
所以只是收集 Claude/ChatGPT 的大量对话输出并没有办法做严格意义的蒸馏,因为无法获得概率分布的信息,也就没有办法让模型快速收敛到 Claude/ChatGPT 的样子。
那么用这些对话输出做 SFT 呢,蒸馏概念扩张后也有人把这一类叫做语料蒸馏。理论上是可以的,但是 SFT 通常作用是把语言风格和偏好进行对齐,一般认为 SFT 会牺牲大模型本身的泛化能力和智能水平,变得更像一个专业模型,我个人倾向于认为这种方式无法让模型获得能力上的提升。
再有一种可能就是把这些对话内容直接作为预训练语料的一部分。在现有的模型论文里也可以看到预训练的时候已经开始使用生成数据了。但是一般认为这种工具调用和 agent 能力需要通过大规模的 RL 才能激发出来,在预训练阶段能发挥多大作用我比较怀疑。而且预训练其实更需要通用的能力,不可能让大量生成数据污染整体的数据质量。我个人倾向猜测预训练阶段会有一部分从 Claude/ChatGPT 来的数据,甚至很难避免,因为他们已经大量成为这个世界数据的一部分了,但靠这个是远远无法实现类似的编码和 agent 能力的。
你看别人只是说一句模型蒸馏,我要费那么大劲去解释,真的是不想再说了。
相似文章
@0xcherry: https://x.com/0xcherry/status/2067610347633025281
本文分析智谱GLM-5.2性能飞跃的原因,认为其40B激活参数在扣除固定开销后提供更大有效容量,使RL后训练更有效;同时回顾中国AI模型发展史,指出大模型路线最终获胜。
@Sxy_Cherotich: 最近找了蛮多 model researchers 交流,一个共识结论是:数据的重要性再次凸显。 前阵子认识了 ex-kimi,在做数据方向创业的@FanqingMengAI,请他来录了一期播客。 聊出的一个最大非共识,是繁青对国内外模型差…
一篇关于AI模型竞争的播客内容,讨论数据重要性、蒸馏与预训练创新,以及与Evolvent AI联创孟繁青的访谈,涉及合成数据、RSI和国内模型差异等话题。
@snowboat84: 你有没有发现,AI里模型的诞生其实相当随意?拿语言模型举例子:先是RNN,再到LSTM,某天突然说Transformer效果好就全换上,后来又拆成Encoder和Decoder,一会儿说BERT一桶浆糊,一会儿又说GPT可以有涌现能力,S…
文章讨论了AI模型诞生的随意性,提出从物理学模型中获得灵感并建立备选模型资料库,将选模型过程工程化的想法。
@vivilinsv: 我特别喜欢和欣赏的一位连续创业者 @quxiaoyin 晓音,这两天在 X 上火起来了。 她提出一个很尖锐的判断:中国开源模型会持续获得市场份额,甚至可能成为美国 AI 生态的“最坏情境”之一—如果中国模型不仅占据 model layer…
讨论中国开源模型可能成为美国AI生态的威胁,以及开源与闭源模型在未来的竞争格局,引发AI圈广泛讨论。
@Xx15573208: 看了很多 Transformer 的文章,能听懂原理,但真正坐下来写代码,完全无从下手。 LLMs-from-scratch 专门解决这个问题:配套《Build a Large Language Model》一书,带你用 PyTorch …
LLMs-from-scratch 是一个 GitHub 仓库,配套《Build a Large Language Model》一书,提供从零用 PyTorch 实现 GPT 的完整代码,涵盖预训练、微调、RLHF 等全流程,已获 93K+ stars,适合想深入理解大模型原理的开发者。