标签
本推文解释如何使用 dlt 收集追踪数据,并通过四个步骤用更小的 1.7B 模型替换 744B 参数的智能体。
本文提出了一种针对视频扩散模型的后训练加速框架,将动态结构稀疏化与少步蒸馏相结合,在保持生成质量的同时实现了显著加速。
本文研究了在大型语言模型(LLM)答案生成过程中置信度相关信息的演化,并提出了未来置信度蒸馏方法。该方法利用后解决方案正确性探针生成的教师置信度估计,对前解决方案隐藏表示进行预测器训练,从而实现可靠且样本高效的置信度估计。
本文提出了一种用于音频情感极性分类的多模态解决方案,通过跨模态转换器集成音频和多语言文本转录,并利用知识蒸馏增强纯音频模型,在推理过程中不增加计算开销。
解释了前沿模型后训练流程中蒸馏的三种用途:将大模型压缩成小模型、合并强化学习专家、以及自我学习。还包括一篇详细说明每个方法对应哪些模型的文章。
一篇关于2026年前沿AI模型如何利用蒸馏技术的文章,涵盖离策略、在策略和自蒸馏阶段,并以Gemma、DeepSeek、GLM、Nemotron和Qwen3为例。
TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
Flow-ERD是一个多智能体交通仿真器,结合了智能体类型感知流匹配与熵正则化蒸馏,以实现既真实又多样化的运动模式,在WOSAC测试基准上排名第一。
NVIDIA 的论文介绍了 Puzzle-75B-A9B,这是一种压缩的混合 MoE 模型,能够在保持质量的同时将服务器吞吐量提高一倍,从而实现大型语言模型的成本高效部署。
介绍两个GitHub上的开源AI agent skills:女娲.skill(27.1K star)和同事.skill(20.1K star),能够蒸馏名人或虚构角色的思维方式,帮助用户用他们的认知框架分析问题。
提出TR-RAG,一种面向英文证据跨语言RAG的教师正则化强化学习方案,将奖励优化与在线策略蒸馏相结合,以解决语言漂移和证据使用不可靠的问题。实验表明,在多个基准测试中,该方法在语言一致性和基于证据的正确性方面均有提升。
一条推文列出了12种压缩技术,用于在保持性能的同时减小LLM大小,包括量化、蒸馏和低秩适应。
LivePortrait 已被蒸馏成一个模型,可直接在浏览器中以每秒25帧的速度运行,由 slperez 在 Hugging Face Spaces 演示中展示。
一位开发者分享了成功微调Qwen 3模型(1.5B和4B)用于智能手机本地使用的经验,附带可下载的离线APK,并计划推出Windows版本。
本文提出了一种说话人解耦的音节标记器,通过对扰动学生表示向干净教师目标进行回归,实现了最先进的音节边界检测,并在语音语言模型理解上相对于SpiRit-LM取得了7%的相对提升。
本文提出UI-MOPD方法,将多教师在线策略蒸馏与持续学习相结合,用于跨平台训练GUI智能体,同时介绍了Uni-GUI数据集。该方法在OSWorld和MobileWorld上分别达到38.2%和12.0%的任务成功率,展示了有效的跨平台能力保持与适应。
Lior On AI 认为高质量的推理轨迹是人工智能的新瓶颈。一个团队从 Claude Fable 5 中提炼了 230 万个推理轨迹到 Qwen3-4B,实现了完美的自洽性和零幻觉方差,并将结果开源。
一条推文,推荐一篇关于蒸馏的周末好读物,作为 Sergio Paniego 和 Ben Burtenshaw 即将进行的直播的入门介绍。