标签
Ali 将 Claude Fable 5 的推理轨迹蒸馏到 Qwen3-4B 中,声称实现了100%的自洽性和零幻觉方差,并将结果开源。
本文研究了不同的离线强化学习损失函数(RFT、RIFT、DFT、Offline GRPO、DPO)在推理蒸馏中是否会在小型语言模型中产生机制上不同的权重更新。使用相同的数学展开和受控设置(Qwen3-4B 和仅注意力的 LoRA),他们发现 SFT、RFT 和 RIFT 的权重增量几乎共线,而 DPO 位于一个近乎正交的子空间中,并取得了最高的准确率。
提出MARD,一个70亿参数的模型,用于机制级药物-药物相互作用预测,采用镜像增强推理蒸馏,以前沿API约1%的成本实现了最先进的准确率,并展示了真正的药理学推理能力而非记忆。
LARK提出了一种基于可学习性的推理轨迹选择方法,用于大语言模型蒸馏。该方法采用可学习性因子和χ²正则化选择策略,平衡效率与泛化能力,在多个模型和任务上持续优于基线方法。
介绍了eXTC,一个具有三个渐进阶段的文本分类器:结构化提示优化以学习自然语言规则手册、将推理蒸馏到紧凑的语言模型中、以及强化学习扩展推理,实现了强大的性能和可解释性。
提出数据-模型兼容性(DMC)指标,用于评估推理数据集在蒸馏过程中与学生模型的匹配程度。实验表明,DMC与蒸馏性能强相关,且基于DMC动态选择数据集可进一步提升推理能力。
本文介绍了一种名为Motab的新型大语言模型推理蒸馏流水线,通过动态监控学生生成并在偏离时回溯到安全状态并借助教师干预,同时缓解离策略和在线策略暴露偏差,取得了约3%的平均性能提升。
本文提出了一种原则性的离线推理蒸馏框架,能够校正教师-学生分布漂移,在数学基准测试上提升推理准确性,且无需在线推理。
一个 35B 参数的 Qwen3.6 模型,使用 Claude-Opus 风格的思维链蒸馏数据微调,并以 GGUF 量化格式发布,可在本地高效推理。