蒸馏有多难?
摘要
该文章探讨了模型蒸馏的难度和成本,以DeepSeek R1蒸馏到Llama 3 8b和Qwen 2.5 7b为例,询问为何蒸馏模型不常见。
我记得大约一年前,DeepSeek R1发布后很快就被蒸馏到了Llama 3 8b和Qwen 2.5 (?) 7b上。为什么我们看不到更多蒸馏模型?蒸馏成本有多高?需要多少token或提示?
相似文章
警惕Qwen/Claude蒸馏模型——它们往往不如基础模型
一篇批判性分析警告:许多Qwen/Claude蒸馏模型使用的训练样本太少(如4K),无法转移实际能力,与DeepSeek-R1等使用约70万样本的官方蒸馏相比,常常反而降低质量而非提升。
@cryptoresetlife: 没有限制的模型好玩啊哈哈 本地LLM模型里现在最喜欢这个 Qwen3.6 35B A3B用Opus 4.7蒸馏后无审核
用户分享对本地LLM模型Qwen3.6 35B A3B的喜爱,该模型使用Opus 4.7蒸馏后无审核限制。
Deepseek,请解释一下你们是如何让一个300B参数的模型比9B参数的模型便宜那么多的?
一位Reddit用户询问DeepSeek如何让一个300B参数的模型比9B参数的模型更便宜,引发了关于效率和成本的讨论。
@Suhail:面对开放权重模型限制的威胁,蒸馏研究将增加10倍。它将引起史翠珊效应…
Suhail预测,对开放权重模型的限制将导致蒸馏研究增加10倍,以此戏弄政府,并可能使AI更高效。
Qwen 3.8 蒸馏
一条推文分享了关于Qwen 3.8 AI模型蒸馏的信息链接,发布者注明未亲自测试。