model-distillation

标签

Cards List
#model-distillation

AI 竞赛突然变得尴尬起来

Hacker News Top ↗ · 3天前 缓存

本文指出,AI 竞赛的叙事已经发生转变:西方实验室如今正悄悄采用中国在开放方面的技术进展,例如 DeepSeek 的 KV 缓存压缩技术(体积比 V1 小 437 倍),这已推动 Anthropic 和 OpenAI 的推理及缓存 token 定价大幅下降。

0 人收藏 0 人点赞
#model-distillation

挫败一场协同的模型蒸馏攻击行动

OpenAI Blog ↗ · 3天前 缓存

OpenAI 披露了一场协同的对抗性模型蒸馏攻击行动,该行动试图从其模型中提取受保护的推理能力,并将该行动的一个核心集群归因于与 Moonshot AI(Kimi 的开发商)相关的个人。

0 人收藏 0 人点赞
#model-distillation

通过逆向蒸馏实现数据遗忘

arXiv cs.LG ↗ · 3天前 缓存

论文提出了逆向蒸馏遗忘(Inverse Distillation Unlearning, IDU)这一统一框架,能够在将多步流匹配或扩散教师模型蒸馏为高效单步学生模型的同时,抑制被遗忘训练数据的生成。该方法仅需教师模型和遗忘集样本,无需访问保留数据或辅助分类器。

0 人收藏 0 人点赞
#model-distillation

Show HN: Jevstiller – 蒸馏Jev为本地模型,设定不一致界限

Hacker News Top ↗ · 4天前 缓存

Jevstiller 是一款工具,能将大型AI模型蒸馏为本地模型,并设定可配置的不一致界限,以此加速推理,同时保证在指定比例的请求上与原模型保持一致。

0 人收藏 0 人点赞
#model-distillation

@wallstengine:Nvidia 首席执行官 Jensen Huang 谈 AI 模型蒸馏:“这叫竞争。你可以随意测试别人的产品……”

X AI KOLs Following ↗ · 5天前 缓存

Nvidia 首席执行官 Jensen Huang 对 AI 模型蒸馏一事发表评论,称其为“竞争”,并主张测试和蒸馏竞争对手的模型属于公平竞争——在业界围绕模型蒸馏实践的争论中,这一立场尤为引人注目。

0 人收藏 0 人点赞
#model-distillation

如果他们的主要创新来源是模型蒸馏,中国真的构成那么大的威胁吗?

Reddit r/artificial ↗ · 5天前

本文质疑中国AI构成的威胁,鉴于他们依赖模型蒸馏且资源劣于OpenAI和Anthropic等美国公司,暗示他们并非迫在眉睫的担忧。

0 人收藏 0 人点赞
#model-distillation

OpenAI 表示 80% 到 90% 的研究都针对 GPT-7、GPT-8 及更远未来,然后蒸馏成廉价小型模型。

Reddit r/singularity ↗ · 6天前

OpenAI 透露,80% 到 90% 的研究都专注于 GPT-7、GPT-8 等未来模型,这些模型随后被蒸馏成更小、更便宜的模型,以供广泛使用。

0 人收藏 0 人点赞
#model-distillation

随着新的Opus/Fable模型发布,如果竞争对手可以基于它们进行训练,美国实验室将如何保持领先?

Reddit r/ArtificialInteligence ↗ · 2026-09-23

这篇文章讨论了在竞争对手进行大规模模型蒸馏并使用美国训练数据供应商的背景下,美国AI实验室如何保持领先优势的担忧。

0 人收藏 0 人点赞
#model-distillation

Viggle/Qwen-Image-2.1-viggle-turbo

Hugging Face Models Trending ↗ · 2026-09-22 缓存

Qwen-Image-2.1 的蒸馏学生模型,由 Viggle 使用分布匹配蒸馏训练,实现在6步而非40步中完成文本到图像生成和图像编辑,从而在保持竞争力质量的同时,性能提升约5倍。

0 人收藏 0 人点赞
#model-distillation

Ambient @ EgoLongQA 2026:将长视频感知蒸馏到小于2B参数的模型中

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

一个从使用工具的智能体蒸馏而来的2B视觉语言模型,通过剪枝其多语言嵌入表以满足参数限制,在长第一人称视频问答任务中取得了第一名,仅使用1.1%的参数就达到了更大管道89%的准确率。

0 人收藏 0 人点赞
#model-distillation

六家中国AI公司被指控激进复制美国前沿模型

Ars Technica ↗ · 2026-09-09 缓存

美国政府机构指控六家中国AI公司通过蒸馏攻击窃取美国领先AI模型的能力,并建议了可能影响AI用户的缓解措施。

0 人收藏 0 人点赞
#model-distillation

构建与评估基于合成语音的固定语音泰语TTS

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文介绍了Wayu-Paxa-TTS-Edge,一个拥有8200万参数的泰语TTS模型,该模型通过语音克隆教师的合成语音进行训练,在无需参考音频的情况下实现了高精度和韵律,适用于设备端使用。

0 人收藏 0 人点赞
#model-distillation

@seclink:我们发现将模型蒸馏到一个架构高度相似的目标模型,其性能远超…

X AI KOLs Following ↗ · 2026-09-01 缓存

研究表明,将AI模型蒸馏到与教师模型相似的架构中,相比蒸馏到差异很大的架构,能获得更好的性能。

0 人收藏 0 人点赞
#model-distillation

@VraserX:Elon Musk在宣誓下承认xAI蒸馏OpenAI的模型,然后当OpenAI切断Musk…时表现出愤怒

X AI KOLs Following ↗ · 2026-08-29 缓存

Elon Musk在宣誓下承认xAI蒸馏了OpenAI的模型,然后当OpenAI切断对Cursor工具的访问时表达了愤怒。

0 人收藏 0 人点赞
#model-distillation

@VraserX: https://x.com/VraserX/status/2093563301330346314

X AI KOLs Timeline ↗ · 2026-08-29 缓存

埃隆·马斯克作证称,xAI 通过模型蒸馏使用 OpenAI 的模型来训练 Grok,突显了 AI 行业中围绕此类做法的伦理和法律争议。

0 人收藏 0 人点赞
#model-distillation

@willdepue: 好论文,不接受宽度混合(我认为固定宽度可能更好),感觉他们应该能够获得……

X AI KOLs Following ↗ · 2026-08-21 缓存

该论文介绍了Matryoshka语言模型套件,将多个模型规模(500M、1.5B、3B)嵌套在一个架构中进行联合训练,使较小的模型能够从与最大模型的蒸馏中受益。

0 人收藏 0 人点赞
#model-distillation

量化感知修复:恢复压缩4位大语言模型的实用方法

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

量化感知修复是一种通过直接从原始未压缩模型蒸馏来恢复压缩4位语言模型的方法,提供比量化感知训练更快、更稳定的性能。

0 人收藏 0 人点赞
#model-distillation

@AlexFinn: 这太吓人了。我在Mac上下载了一个无审查版的Qwen 3.8 27B。它简直可以做你想做的任何事。第一…

X AI KOLs Timeline ↗ · 2026-08-20 缓存

作者表达了对无审查AI模型如Qwen 3.8 27B易于获取的担忧,并质疑在开源进步面前安全法规的有效性。

0 人收藏 0 人点赞
#model-distillation

SimpleOPD:面向长上下文推理的简单分词器无关在策略蒸馏方法

arXiv cs.CL ↗ · 2026-08-17 缓存

本文提出SimpleOPD方法,实现了从长上下文推理教师模型到短上下文学生模型的在职蒸馏。该方法通过解决分词器不匹配与训练不稳定问题,有效提升了数学推理能力。

0 人收藏 0 人点赞
#model-distillation

Qwen 3.8 蒸馏

Reddit r/LocalLLaMA ↗ · 2026-08-16

一条推文分享了关于Qwen 3.8 AI模型蒸馏的信息链接,发布者注明未亲自测试。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈