distillation

标签

Cards List
#distillation

@LiorOnAI: 瓶颈不再仅仅是算力或参数。而是获取高质量的推理轨迹。一旦数百万……

X AI KOLs Timeline · 2026-07-04 缓存

Lior On AI 认为高质量的推理轨迹是人工智能的新瓶颈。一个团队从 Claude Fable 5 中提炼了 230 万个推理轨迹到 Qwen3-4B,实现了完美的自洽性和零幻觉方差,并将结果开源。

0 人收藏 0 人点赞
#distillation

@ariG23498: 适合对蒸馏感兴趣的人们的周末好读物。这也是 @SergioPaniego 和 @ben_burten… 的入门指南。

X AI KOLs Timeline · 2026-07-04 缓存

一条推文,推荐一篇关于蒸馏的周末好读物,作为 Sergio Paniego 和 Ben Burtenshaw 即将进行的直播的入门介绍。

0 人收藏 0 人点赞
#distillation

@mylifcc: 他们拿了 230 万条 Claude(一个很强很贵的AI)在推理时候留下的“思考过程”数据,去训练了一个很小的模型(Qwen3-4B,只有40亿参数)。 结果这个小模型在测试里表现得非常“稳”: 它在512次不同测试里,每次输出都完全一样…

X AI KOLs Timeline · 2026-07-04 缓存

使用230万条Claude推理轨迹数据蒸馏Qwen3-4B模型,得到100%输出一致性和极低幻觉的小模型,且学生模型未被教师模型限制,还收敛出一个普世真理。

0 人收藏 0 人点赞
#distillation

CineMobile:用于电影级摄像机运动生成的设备端图像到视频扩散

Hugging Face Daily Papers · 2026-07-04 缓存

本文介绍了CineMobile,一种高效的设备端图像到视频生成方法,通过蒸馏引导剪枝、扩散蒸馏和混合量化,相较于教师模型实现了40倍加速,使得在移动设备上实现电影级摄影机运动效果成为可能。

0 人收藏 0 人点赞
#distillation

三思而后行:将树搜索蒸馏为冻结VLA模型的动作评估

Hugging Face Daily Papers · 2026-07-04 缓存

提出了SVA框架,该框架在冻结的VLA模型中将动作生成与后果评估解耦,使用蒙特卡洛树搜索并将其蒸馏为轻量级Q值模型,从而提升泛化能力和任务成功率,同时降低计算成本。

0 人收藏 0 人点赞
#distillation

程序性记忆蒸馏:面向自我改进语言模型的在线反思

arXiv cs.AI · 2026-07-03 缓存

程序性记忆蒸馏(PMD)将来自强化学习 rollout 的跨回合信号转化为可复用的程序性记忆,并在训练过程中将其蒸馏到策略权重中,从而在推理时无需记忆即可实现自我改进语言模型。实验表明,PMD 在 SCIKNOWEVAL 上比 SDPO 提升 3.8-5.5%,在 LIVECODEBENCH 上提升 7.9-13.6%。

0 人收藏 0 人点赞
#distillation

Anthropic正在移除用于检测中国竞争对手的隐蔽代码

Reddit r/singularity · 2026-07-02 缓存

Anthropic正在从其Claude Code工具中移除隐藏的隐写代码,这些代码曾用于检测和防止中国竞争对手的未经授权使用和模型蒸馏,理由是其已部署了更强的防御措施。

0 人收藏 0 人点赞
#distillation

通过不动点流的自条件化流映射语言模型

arXiv cs.CL · 2026-07-02 缓存

介绍了不动点流,一种自条件化流语言模型,将自条件化视为不动点迭代,从而能够蒸馏出几步流映射语言模型 (FMLM⋆),在OpenWebText上优于先前工作。

0 人收藏 0 人点赞
#distillation

行为克隆并非所需全部:噪声专家反馈下在线策略蒸馏的最优性

arXiv cs.LG · 2026-07-01 缓存

本文提出一个噪声专家模型来解释离线与在线模仿学习之间的差距,表明从噪声轨迹中离线学习需要指数级样本复杂度,而在线策略蒸馏可实现多项式依赖。该分析引出一种替代损失函数,实验证实了理论发现。

0 人收藏 0 人点赞
#distillation

@johnschulman2: 人们有时会问,既然通用模型越来越好,为什么还要微调。桥水基金的工作是一个很好的提醒…

X AI KOLs Timeline · 2026-07-01 缓存

John Schulman 强调桥水基金的工作表明,使用专家标注数据进行微调,在金融文档分类上能显著优于仅用提示的方法。

0 人收藏 0 人点赞
#distillation

@Michaelzsguo: 一本及时的书。Dario声称像DeepSeek和GLM这样的中国模型是从Anthropic模型蒸馏而来,这就是它们……的原因。

X AI KOLs Timeline · 2026-06-30 缓存

Sebastian Raschka的新书《Build a Reasoning Model (From Scratch)》涵盖了推理扩展、强化学习和蒸馏。该公告还提到了Dario Amodei关于中国模型从Anthropic模型蒸馏的评论。

0 人收藏 0 人点赞
#distillation

@rasbt:经过18个月的写作、编码和实验,《Build a Reasoning Model (From Scratch)》终于问世!我的第一本……

X AI KOLs Timeline · 2026-06-30 缓存

Sebastian Raschka宣布其著作《Build a Reasoning Model (From Scratch)》在历时18个月的工作后正式发布,内容涵盖推理扩展、强化学习和从头开始的蒸馏技术。

0 人收藏 0 人点赞
#distillation

ascend-tribe/openPangu-2.0-Flash(他们尚未上传至HuggingFace)

Reddit r/LocalLLaMA · 2026-06-30

openPangu-2.0-Flash 是一个 92B MoE 模型,激活参数为 6B,上下文长度为 512k,在昇腾上使用 34T tokens 训练,融合了慢速/快速思维以及多个RL训练阶段。

0 人收藏 0 人点赞
#distillation

ATOD:面向多轮自主智能体的退火轮次感知在线策略蒸馏

arXiv cs.AI · 2026-06-29 缓存

本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。

0 人收藏 0 人点赞
#distillation

DuoMem: 面向设备端能力型内存代理的双空间蒸馏框架

Hugging Face Daily Papers · 2026-06-29 缓存

DuoMem 是一种双空间蒸馏框架,通过上下文空间蒸馏和参数空间蒸馏,将大型语言模型的过程性问题解决能力迁移至紧凑的学生模型,以极少的额外参数实现高性能并提升推理速度。该框架在 ALFWorld 上,将 4B 参数规模模型的任务成功率从 4.3% 提升至 77.9%。

0 人收藏 0 人点赞
#distillation

扩展视野而非参数:以35B智能体达到万亿参数性能

Hugging Face Daily Papers · 2026-06-29 缓存

介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。

0 人收藏 0 人点赞
#distillation

让一个4B本地模型真正发挥作用:设备端“记忆助手”背后的distill-on-idle流水线

Reddit r/LocalLLaMA · 2026-06-26

描述了一种'distill-on-idle'流水线,它使得一个4B参数的本地模型能够作为设备端记忆助手有效运行,展示了小型模型的实际应用。

0 人收藏 0 人点赞
#distillation

@VraserX: 尽管中国最近获得了大量算力,为什么感觉他们仍在蒸馏美国模型?这…

X AI KOLs Following · 2026-06-26 缓存

一位评论者质疑,尽管中国获得了大量算力资源,为何似乎仍依赖于蒸馏美国AI模型,而非从头开始训练基础模型,想知道真正的瓶颈是什么。

0 人收藏 0 人点赞
#distillation

@bgurley: 如果你即将实现AGI或ASI,为什么你的模型还不够智能,无法实时识别间谍蒸馏?…

X AI KOLs Following · 2026-06-26 缓存

比尔·格利批评声称具备AGI/ASI能力的AI公司,因为它们连解决诸如实时检测间谍蒸馏这类更简单的问题都做不到。

0 人收藏 0 人点赞
#distillation

SKILL-DISCO:将智能体轨迹提炼并编译为可重用的程序化技能

arXiv cs.AI · 2026-06-26 缓存

Skill-DisCo 是一个框架,它将可重用的程序化技能从成功的智能体轨迹中提炼出来,并将其编译成可调用、可执行的程序。在 ALFWorld 和 WebArena 上的实验表明,该框架提高了成功率并减少了智能体的回合数。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈