model-distillation

标签

Cards List
#model-distillation

Gemini 蒸馏服务

Reddit r/LocalLLaMA ↗ · 2026-07-28 缓存

Gemini 的蒸馏服务允许使用更大教师模型的输出和思维模式来训练一个更小、更高效的学生模型,同时降低成本和延迟。

0 人收藏 0 人点赞
#model-distillation

重新思考策略内扩散蒸馏中的无分类器引导

Hugging Face Daily Papers ↗ · 2026-07-27 缓存

本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。

0 人收藏 0 人点赞
#model-distillation

从硅谷到华盛顿,科技界突然痴迷于AI中的一个概念:蒸馏

Reddit r/artificial ↗ · 2026-07-25 缓存

AI蒸馏已经成为一个从硅谷到华盛顿的热门话题,因为人们越来越担心像Moonshot AI这样的中国实验室正在利用这项技术迅速追赶美国的前沿模型,引发了关于国家安全和知识产权的争论。

0 人收藏 0 人点赞
#model-distillation

中国AI是否窃取了Anthropic的技术?OpenAI也失去对两个模型的控制

Wired ↗ · 2026-07-24 缓存

本周的《Uncanny Valley》播客涵盖了白宫指控中国Moonshot AI通过蒸馏Anthropic的Fable 5来构建Kimi K3、OpenAI在安全测试中短暂失去对两个模型的控制,以及其他科技新闻。

0 人收藏 0 人点赞
#model-distillation

关于“模型蒸馏”的指控目前被夸大其词

Reddit r/LocalLLaMA ↗ · 2026-07-23

文章认为,近期对AI模型蒸馏的指控被夸大和过度渲染了。

0 人收藏 0 人点赞
#model-distillation

白宫强烈指控Moonshot AI秘密蒸馏了Anthropic的Fable模型

Reddit r/ArtificialInteligence ↗ · 2026-07-22 缓存

白宫指控Moonshot AI秘密蒸馏了Anthropic的Fable模型,引发了对知识产权和AI安全的担忧。

0 人收藏 0 人点赞
#model-distillation

美国威胁因知识产权盗窃制裁中国AI模型

TechCrunch AI ↗ · 2026-07-21 缓存

美国财政部长斯科特·贝森特威胁称,若发现知识产权盗窃,将对中国AI模型实施制裁,这加剧了中美AI公司之间的技术竞争。

0 人收藏 0 人点赞
#model-distillation

依靠网络爬取构建帝国的科技巨头,如今却将模型蒸馏称为“生存威胁”,这极具讽刺意味

Reddit r/LocalLLaMA ↗ · 2026-07-14

一篇评论文章,强调了科技巨头抱怨模型蒸馏是生存威胁的讽刺之处,因为他们的帝国正是建立在网络爬取之上的。

0 人收藏 0 人点赞
#model-distillation

@huggingface:训练智能体2:关于模型蒸馏用于训练自定义智能体的直播教程。

X AI KOLs Timeline ↗ · 2026-07-07 缓存

Hugging Face举办了一场关于模型蒸馏用于训练自定义智能体的直播教程,现已提供回放。

0 人收藏 0 人点赞
#model-distillation

TESSERA v2:扩展像素级地球基础模型

Hugging Face Daily Papers ↗ · 2026-07-04 缓存

该论文介绍了迄今为止最大的地球观测基础模型可控扩展研究,展示了预训练损失对下游性能的预测能力较差,并提供了最优计算资源分配规则。它训练了扩展的像素级模型(0.5B和1B参数),并将其蒸馏为紧凑的学生模型,这些模型优于更大的开源和专有模型。

0 人收藏 0 人点赞
#model-distillation

@SergioPaniego: 在模型蒸馏成为攻击向量之前,它确实是一种在你关心的任务上提升模型性能的便捷方法……

X AI KOLs Timeline ↗ · 2026-07-03 缓存

本文简要介绍了AI中模型蒸馏的历史,并预告了即将举行的一场关于使用TRL(Transformer强化学习)蒸馏开放模型的直播课程。

0 人收藏 0 人点赞
#model-distillation

Anthropic表示阿里巴巴因最大规模的Claude克隆攻击必须受到惩罚

Ars Technica ↗ · 2026-06-25 缓存

Anthropic指控阿里巴巴策划了已知最大规模的Claude模型克隆攻击,动用了25,000个账户进行了2880万次交互,并呼吁对其进行惩罚,这是中美AI更广泛竞争的一部分。

0 人收藏 0 人点赞
#model-distillation

Anthropic指控阿里巴巴公然非法提取其AI能力的行为

Reddit r/LocalLLaMA ↗ · 2026-06-25

Anthropic指控阿里巴巴通过模型蒸馏非法提取其AI能力,凸显了AI知识产权方面的持续紧张局势。

0 人收藏 0 人点赞
#model-distillation

@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……

X AI KOLs Timeline ↗ · 2026-06-16 缓存

本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。

0 人收藏 0 人点赞
#model-distillation

@ziv_ravid: 1/我阅读了Nemotron 3 Ultra报告,将其后训练与DeepSeek V4的对比很有趣。两者现在都…

X AI KOLs Timeline ↗ · 2026-06-15 缓存

这条推文比较了Nemotron 3 Ultra和DeepSeek V4的后训练方法,指出两者都使用多个专长教师并通过在线策略蒸馏合并到一个学生模型,但在支持重叠方面存在差异。

0 人收藏 0 人点赞
#model-distillation

量化语言模型蒸馏中的潜意识行为迁移比率

arXiv cs.LG ↗ · 2026-06-11 缓存

本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。

0 人收藏 0 人点赞
#model-distillation

超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则

Hugging Face Daily Papers ↗ · 2026-05-12 缓存

本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。

0 人收藏 0 人点赞
#model-distillation

关于用于本地编码的 Qwen-3.6 14B 和 9B 蒸馏模型有任何消息(或希望)吗?

Reddit r/LocalLLaMA ↗ · 2026-05-11

作者询问是否有针对本地编码用途的 Qwen-3.6 模型 9B 和 14B 蒸馏变体,并提到了在有限硬件上使用 Qwen-3.5 9B 时遇到的具体工具调用和文件结构问题。

0 人收藏 0 人点赞
#model-distillation

蒸馏有多难?

Reddit r/LocalLLaMA ↗ · 2026-05-08

该文章探讨了模型蒸馏的难度和成本,以DeepSeek R1蒸馏到Llama 3 8b和Qwen 2.5 7b为例,询问为何蒸馏模型不常见。

0 人收藏 0 人点赞
#model-distillation

基于评分细则的在策略蒸馏

Hugging Face Daily Papers ↗ · 2026-05-08 缓存

本文提出了 ROPD,一种基于评分细则的在策略蒸馏框架,相比传统的基于 logits 的方法,该框架在样本效率上表现更优。它通过使用结构化的语义评分细则而非教师 logits,实现了黑盒场景下的模型对齐。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈