标签
一位退休工程师提出了蓝图蒸馏(BPD)方法,将昂贵的教师分析与学生压缩分离,适用于Kimi K3等大型MoE模型,从而允许复用压缩蓝图来生成多种规模的学生模型。
介绍字节前缀边缘化(BPM)用于跨分词器同策略蒸馏,在共享字节空间上重新表达教师分词在学生词汇表上的分布,在数学和编程基准测试中优于基线方法。
AI蒸馏已经成为一个从硅谷到华盛顿的热门话题,因为人们越来越担心像Moonshot AI这样的中国实验室正在利用这项技术迅速追赶美国的前沿模型,引发了关于国家安全和知识产权的争论。
Wired报道称,硅谷在对待中国开放权重AI模型方面存在严重分歧:一些初创公司反对禁令,而Anthropic等AI巨头则因担忧知识产权盗窃和缺乏安全护栏而推动监管。
Suhail预测,对开放权重模型的限制将导致蒸馏研究增加10倍,以此戏弄政府,并可能使AI更高效。
专家们对中国公司Moonshot通过蒸馏复制Anthropic的Fable模型来实现Kimi K3的先进能力表示怀疑,理由是时间不足和技术限制。
VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。
白宫内部对于如何应对中国快速进步的AI存在分歧,争论焦点在于实施更严格的管控还是制定可行的限制措施,尤其是针对美国模型(如Anthropic的Claude Fable 5)遭受的蒸馏攻击。
美国财政部威胁对中国AI公司Moonshot实施制裁,指控其涉嫌蒸馏Anthropic的Fable模型,此举加剧了围绕AI知识产权盗窃和出口管制违规的紧张局势。
会话自适应正交蒸馏(SAOD)是一种将7440亿参数模型(1.5TB)压缩至100GB以下的技术,大幅降低存储和推理成本。
前白宫科学顾问声称Kimi K3是从Anthropic的Fable模型蒸馏而来的。
据称月之暗面AI使用复杂方法蒸馏Anthropic的Fable模型以开发其K3模型,从而规避检测,引发了对AI开发中大规模工业间谍行为的担忧。
MUX 提出了一种无损连续推理的方法,通过将离散推理步骤蒸馏到多路复用的潜在令牌中,这些令牌编码了子词的叠加,实现了更高的带宽,并在语言模型推理任务中支持并行探索。
文章认为,AI公司建立在昂贵模型训练之上的竞争护城河很容易被蒸馏(distillation)所削弱——即通过重复API查询来复制模型,行业实践如xAI在OpenAI模型上训练Grok、Anthropic指控中国实验室挖掘Claude等行为都印证了这一点。
@factoryAI 的 @enoreyes 的一句话暗示,蒸馏几乎是不可阻挡的,模型实验室可能已经认识到了智能的形态。
对输出相似性的分析表明,像Kimi K3、DeepSeek V4和GLM 5.2这样的中国AI前沿模型展现出风格差异,显示出有意义的独立发展,这挑战了其进展严重依赖从美国模型蒸馏的说法。