标签
Gemini 的蒸馏服务允许使用更大教师模型的输出和思维模式来训练一个更小、更高效的学生模型,同时降低成本和延迟。
本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。
AI蒸馏已经成为一个从硅谷到华盛顿的热门话题,因为人们越来越担心像Moonshot AI这样的中国实验室正在利用这项技术迅速追赶美国的前沿模型,引发了关于国家安全和知识产权的争论。
本周的《Uncanny Valley》播客涵盖了白宫指控中国Moonshot AI通过蒸馏Anthropic的Fable 5来构建Kimi K3、OpenAI在安全测试中短暂失去对两个模型的控制,以及其他科技新闻。
白宫指控Moonshot AI秘密蒸馏了Anthropic的Fable模型,引发了对知识产权和AI安全的担忧。
美国财政部长斯科特·贝森特威胁称,若发现知识产权盗窃,将对中国AI模型实施制裁,这加剧了中美AI公司之间的技术竞争。
一篇评论文章,强调了科技巨头抱怨模型蒸馏是生存威胁的讽刺之处,因为他们的帝国正是建立在网络爬取之上的。
Hugging Face举办了一场关于模型蒸馏用于训练自定义智能体的直播教程,现已提供回放。
该论文介绍了迄今为止最大的地球观测基础模型可控扩展研究,展示了预训练损失对下游性能的预测能力较差,并提供了最优计算资源分配规则。它训练了扩展的像素级模型(0.5B和1B参数),并将其蒸馏为紧凑的学生模型,这些模型优于更大的开源和专有模型。
本文简要介绍了AI中模型蒸馏的历史,并预告了即将举行的一场关于使用TRL(Transformer强化学习)蒸馏开放模型的直播课程。
Anthropic指控阿里巴巴策划了已知最大规模的Claude模型克隆攻击,动用了25,000个账户进行了2880万次交互,并呼吁对其进行惩罚,这是中美AI更广泛竞争的一部分。
Anthropic指控阿里巴巴通过模型蒸馏非法提取其AI能力,凸显了AI知识产权方面的持续紧张局势。
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
这条推文比较了Nemotron 3 Ultra和DeepSeek V4的后训练方法,指出两者都使用多个专长教师并通过在线策略蒸馏合并到一个学生模型,但在支持重叠方面存在差异。
本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。
本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。
作者询问是否有针对本地编码用途的 Qwen-3.6 模型 9B 和 14B 蒸馏变体,并提到了在有限硬件上使用 Qwen-3.5 9B 时遇到的具体工具调用和文件结构问题。
该文章探讨了模型蒸馏的难度和成本,以DeepSeek R1蒸馏到Llama 3 8b和Qwen 2.5 7b为例,询问为何蒸馏模型不常见。
本文提出了 ROPD,一种基于评分细则的在策略蒸馏框架,相比传统的基于 logits 的方法,该框架在样本效率上表现更优。它通过使用结构化的语义评分细则而非教师 logits,实现了黑盒场景下的模型对齐。