标签
本文指出,AI 竞赛的叙事已经发生转变:西方实验室如今正悄悄采用中国在开放方面的技术进展,例如 DeepSeek 的 KV 缓存压缩技术(体积比 V1 小 437 倍),这已推动 Anthropic 和 OpenAI 的推理及缓存 token 定价大幅下降。
OpenAI 披露了一场协同的对抗性模型蒸馏攻击行动,该行动试图从其模型中提取受保护的推理能力,并将该行动的一个核心集群归因于与 Moonshot AI(Kimi 的开发商)相关的个人。
论文提出了逆向蒸馏遗忘(Inverse Distillation Unlearning, IDU)这一统一框架,能够在将多步流匹配或扩散教师模型蒸馏为高效单步学生模型的同时,抑制被遗忘训练数据的生成。该方法仅需教师模型和遗忘集样本,无需访问保留数据或辅助分类器。
Jevstiller 是一款工具,能将大型AI模型蒸馏为本地模型,并设定可配置的不一致界限,以此加速推理,同时保证在指定比例的请求上与原模型保持一致。
Nvidia 首席执行官 Jensen Huang 对 AI 模型蒸馏一事发表评论,称其为“竞争”,并主张测试和蒸馏竞争对手的模型属于公平竞争——在业界围绕模型蒸馏实践的争论中,这一立场尤为引人注目。
本文质疑中国AI构成的威胁,鉴于他们依赖模型蒸馏且资源劣于OpenAI和Anthropic等美国公司,暗示他们并非迫在眉睫的担忧。
OpenAI 透露,80% 到 90% 的研究都专注于 GPT-7、GPT-8 等未来模型,这些模型随后被蒸馏成更小、更便宜的模型,以供广泛使用。
这篇文章讨论了在竞争对手进行大规模模型蒸馏并使用美国训练数据供应商的背景下,美国AI实验室如何保持领先优势的担忧。
Qwen-Image-2.1 的蒸馏学生模型,由 Viggle 使用分布匹配蒸馏训练,实现在6步而非40步中完成文本到图像生成和图像编辑,从而在保持竞争力质量的同时,性能提升约5倍。
一个从使用工具的智能体蒸馏而来的2B视觉语言模型,通过剪枝其多语言嵌入表以满足参数限制,在长第一人称视频问答任务中取得了第一名,仅使用1.1%的参数就达到了更大管道89%的准确率。
美国政府机构指控六家中国AI公司通过蒸馏攻击窃取美国领先AI模型的能力,并建议了可能影响AI用户的缓解措施。
本文介绍了Wayu-Paxa-TTS-Edge,一个拥有8200万参数的泰语TTS模型,该模型通过语音克隆教师的合成语音进行训练,在无需参考音频的情况下实现了高精度和韵律,适用于设备端使用。
研究表明,将AI模型蒸馏到与教师模型相似的架构中,相比蒸馏到差异很大的架构,能获得更好的性能。
Elon Musk在宣誓下承认xAI蒸馏了OpenAI的模型,然后当OpenAI切断对Cursor工具的访问时表达了愤怒。
埃隆·马斯克作证称,xAI 通过模型蒸馏使用 OpenAI 的模型来训练 Grok,突显了 AI 行业中围绕此类做法的伦理和法律争议。
该论文介绍了Matryoshka语言模型套件,将多个模型规模(500M、1.5B、3B)嵌套在一个架构中进行联合训练,使较小的模型能够从与最大模型的蒸馏中受益。
量化感知修复是一种通过直接从原始未压缩模型蒸馏来恢复压缩4位语言模型的方法,提供比量化感知训练更快、更稳定的性能。
作者表达了对无审查AI模型如Qwen 3.8 27B易于获取的担忧,并质疑在开源进步面前安全法规的有效性。
本文提出SimpleOPD方法,实现了从长上下文推理教师模型到短上下文学生模型的在职蒸馏。该方法通过解决分词器不匹配与训练不稳定问题,有效提升了数学推理能力。