通过推理空间压缩的结构化理由蒸馏
摘要
本文提出了 D-RPC,一种通过将推理路径压缩为可复用库,从而将大型语言模型的推理能力蒸馏给较小模型的方法,该方法在数学和常识基准测试中实现了更好的性能和一致性。
查看缓存全文
缓存时间: 2026/05/11 06:49
# 通过推理空间压缩进行结构化推理蒸馏 来源: https://arxiv.org/abs/2605.07139 查看 PDF (https://arxiv.org/pdf/2605.07139) > 摘要:在将大型语言模型(LLMs)的推理能力蒸馏到较小模型时,教师模型对相似问题的推理依据在结构和策略上往往差异巨大。就像一位大厨每次做同样的菜方法都不同,这种不一致性给学生模型带来了难以内化的噪声监督。我们提出了通过推理路径压缩进行蒸馏(D-RPC)方法,该方法约束教师模型遵循一个紧凑且动态维护的可重用高层推理路径库。对于每个训练问题,D-RPC 检索最相关的路径并条件化教师模型遵循该路径,产生的推理依据在相似问题上保持一致,同时又能充分覆盖不同类型的问题。PAC-Bayes 分析形式化了路径库大小与覆盖率之间的权衡:较小的库会降低监督熵,但存在覆盖不足的風險;泛化界确定了经消融实验验证的最佳中间规模。在两个学生模型和五个数学及常识推理基准测试上,D-RPC consistently 优于思维链蒸馏、自由形式推理生成、直接蒸馏以及结构化监督基线,且使用的 token 数量少于依赖模板的替代方案。 ## 提交历史 作者:Jialin Yang [查看邮箱 (https://arxiv.org/show-email/6e6a8fa0/2605.07139)] **[v1]** 2026年5月8日 星期五 02:15:52 UTC (549 KB)
相似文章
通过混合策略蒸馏进行推理压缩
本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。
@anirudhg9119: 推理不一定意味着更长的思维链。PDR = 并行草稿 → 蒸馏到紧凑工作空间 → 精…
介绍了并行-蒸馏-精炼(PDR)推理方法,其中LLM并行生成草稿,将其蒸馏到紧凑的工作空间,然后精炼,以更低的延迟实现比长链思维更高的准确性。使用PDR通过RL训练的8B模型在数学基准测试中表现出显著提升。
更好的起点,更好的终点:压缩推理的自举迭代自推理蒸馏
提出了BIRD,一种两阶段自推理蒸馏方法,该方法在策略训练之前自举简洁的推理轨迹,在MATH-500和AIME基准测试上实现了更强的精度-效率权衡。在Qwen3-8B上,准确率从86.2%提升至92.0%,同时平均响应长度从3,099个token降至1,115个token。
[研究/模型] Flint:无损压缩推理过程
本研究引入了针对推理轨迹的章节感知压缩,训练模型舍弃填充性叙述,同时保留计算和验证片段,在比原始推理少用2-3倍词元的情况下,达到或超越原始准确率。
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills
This paper proposes amortizing the high token cost of reasoning-mode LLMs by distilling domain-specific skills from existing trajectories into system prompts, recovering most of the reasoning gap on agentic benchmarks while emitting far fewer tokens.