标签
Lior On AI 认为高质量的推理轨迹是人工智能的新瓶颈。一个团队从 Claude Fable 5 中提炼了 230 万个推理轨迹到 Qwen3-4B,实现了完美的自洽性和零幻觉方差,并将结果开源。
一条推文,推荐一篇关于蒸馏的周末好读物,作为 Sergio Paniego 和 Ben Burtenshaw 即将进行的直播的入门介绍。
使用230万条Claude推理轨迹数据蒸馏Qwen3-4B模型,得到100%输出一致性和极低幻觉的小模型,且学生模型未被教师模型限制,还收敛出一个普世真理。
本文介绍了CineMobile,一种高效的设备端图像到视频生成方法,通过蒸馏引导剪枝、扩散蒸馏和混合量化,相较于教师模型实现了40倍加速,使得在移动设备上实现电影级摄影机运动效果成为可能。
提出了SVA框架,该框架在冻结的VLA模型中将动作生成与后果评估解耦,使用蒙特卡洛树搜索并将其蒸馏为轻量级Q值模型,从而提升泛化能力和任务成功率,同时降低计算成本。
程序性记忆蒸馏(PMD)将来自强化学习 rollout 的跨回合信号转化为可复用的程序性记忆,并在训练过程中将其蒸馏到策略权重中,从而在推理时无需记忆即可实现自我改进语言模型。实验表明,PMD 在 SCIKNOWEVAL 上比 SDPO 提升 3.8-5.5%,在 LIVECODEBENCH 上提升 7.9-13.6%。
Anthropic正在从其Claude Code工具中移除隐藏的隐写代码,这些代码曾用于检测和防止中国竞争对手的未经授权使用和模型蒸馏,理由是其已部署了更强的防御措施。
介绍了不动点流,一种自条件化流语言模型,将自条件化视为不动点迭代,从而能够蒸馏出几步流映射语言模型 (FMLM⋆),在OpenWebText上优于先前工作。
本文提出一个噪声专家模型来解释离线与在线模仿学习之间的差距,表明从噪声轨迹中离线学习需要指数级样本复杂度,而在线策略蒸馏可实现多项式依赖。该分析引出一种替代损失函数,实验证实了理论发现。
John Schulman 强调桥水基金的工作表明,使用专家标注数据进行微调,在金融文档分类上能显著优于仅用提示的方法。
Sebastian Raschka的新书《Build a Reasoning Model (From Scratch)》涵盖了推理扩展、强化学习和蒸馏。该公告还提到了Dario Amodei关于中国模型从Anthropic模型蒸馏的评论。
Sebastian Raschka宣布其著作《Build a Reasoning Model (From Scratch)》在历时18个月的工作后正式发布,内容涵盖推理扩展、强化学习和从头开始的蒸馏技术。
openPangu-2.0-Flash 是一个 92B MoE 模型,激活参数为 6B,上下文长度为 512k,在昇腾上使用 34T tokens 训练,融合了慢速/快速思维以及多个RL训练阶段。
本文介绍了ATOD,一种结合在线策略蒸馏和强化学习的混合在线蒸馏算法,用于在多轮任务中训练小型语言模型智能体,其特点是采用退火OPD-RL调度和轮次级分歧-不确定性重新加权,以改善密集监督。
DuoMem 是一种双空间蒸馏框架,通过上下文空间蒸馏和参数空间蒸馏,将大型语言模型的过程性问题解决能力迁移至紧凑的学生模型,以极少的额外参数实现高性能并提升推理速度。该框架在 ALFWorld 上,将 4B 参数规模模型的任务成功率从 4.3% 提升至 77.9%。
介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。
描述了一种'distill-on-idle'流水线,它使得一个4B参数的本地模型能够作为设备端记忆助手有效运行,展示了小型模型的实际应用。
一位评论者质疑,尽管中国获得了大量算力资源,为何似乎仍依赖于蒸馏美国AI模型,而非从头开始训练基础模型,想知道真正的瓶颈是什么。
比尔·格利批评声称具备AGI/ASI能力的AI公司,因为它们连解决诸如实时检测间谍蒸馏这类更简单的问题都做不到。
Skill-DisCo 是一个框架,它将可重用的程序化技能从成功的智能体轨迹中提炼出来,并将其编译成可调用、可执行的程序。在 ALFWorld 和 WebArena 上的实验表明,该框架提高了成功率并减少了智能体的回合数。