reasoning-distillation

标签

Cards List
#reasoning-distillation

@charles_irl: kino

X AI KOLs Timeline · 2026-07-04 缓存

Ali 将 Claude Fable 5 的推理轨迹蒸馏到 Qwen3-4B 中,声称实现了100%的自洽性和零幻觉方差,并将结果开源。

0 人收藏 0 人点赞
#reasoning-distillation

离线推理训练中的权重空间几何

arXiv cs.LG · 2026-06-24 缓存

本文研究了不同的离线强化学习损失函数(RFT、RIFT、DFT、Offline GRPO、DPO)在推理蒸馏中是否会在小型语言模型中产生机制上不同的权重更新。使用相同的数学展开和受控设置(Qwen3-4B 和仅注意力的 LoRA),他们发现 SFT、RFT 和 RIFT 的权重增量几乎共线,而 DPO 位于一个近乎正交的子空间中,并取得了最高的准确率。

0 人收藏 0 人点赞
#reasoning-distillation

MARD:镜像增强推理蒸馏用于机制级药物-药物相互作用预测

arXiv cs.CL · 2026-06-12 缓存

提出MARD,一个70亿参数的模型,用于机制级药物-药物相互作用预测,采用镜像增强推理蒸馏,以前沿API约1%的成本实现了最先进的准确率,并展示了真正的药理学推理能力而非记忆。

0 人收藏 0 人点赞
#reasoning-distillation

LARK:基于可学习性的轨迹选择方法用于高效推理蒸馏

arXiv cs.LG · 2026-06-01 缓存

LARK提出了一种基于可学习性的推理轨迹选择方法,用于大语言模型蒸馏。该方法采用可学习性因子和χ²正则化选择策略,平衡效率与泛化能力,在多个模型和任务上持续优于基线方法。

0 人收藏 0 人点赞
#reasoning-distillation

结构化提示优化与强化学习结合实现复杂文本的全局与局部可解释性

arXiv cs.CL · 2026-05-29 缓存

介绍了eXTC,一个具有三个渐进阶段的文本分类器:结构化提示优化以学习自然语言规则手册、将推理蒸馏到紧凑的语言模型中、以及强化学习扩展推理,实现了强大的性能和可解释性。

0 人收藏 0 人点赞
#reasoning-distillation

定制课程:基于动态数据-模型兼容性的以学生为中心的推理蒸馏

arXiv cs.AI · 2026-05-29 缓存

提出数据-模型兼容性(DMC)指标,用于评估推理数据集在蒸馏过程中与学生模型的匹配程度。实验表明,DMC与蒸馏性能强相关,且基于DMC动态选择数据集可进一步提升推理能力。

0 人收藏 0 人点赞
#reasoning-distillation

偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差

arXiv cs.CL · 2026-05-20 缓存

本文介绍了一种名为Motab的新型大语言模型推理蒸馏流水线,通过动态监控学生生成并在偏离时回溯到安全状态并借助教师干预,同时缓解离策略和在线策略暴露偏差,取得了约3%的平均性能提升。

0 人收藏 0 人点赞
#reasoning-distillation

面向大型语言模型的分布校正离线数据蒸馏

arXiv cs.CL · 2026-05-15 缓存

本文提出了一种原则性的离线推理蒸馏框架,能够校正教师-学生分布漂移,在数学基准测试上提升推理准确性,且无需在线推理。

0 人收藏 0 人点赞
#reasoning-distillation

hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF

Hugging Face Models Trending · 2026-04-18 缓存

一个 35B 参数的 Qwen3.6 模型,使用 Claude-Opus 风格的思维链蒸馏数据微调,并以 GGUF 量化格式发布,可在本地高效推理。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈