无需推理轨迹训练领域专家蒸馏的专家模型
摘要
本文证明,仅通过问答对训练的专家模型会隐式选择潜在推理轨迹,而使用学生蒸馏作为探针揭示了专业化和泛化配置文件之间的强相关性,从而实现领域精确性和通用能力之间的可控权衡。
arXiv:2609.13770v1 Announce Type: new
Abstract: 专家蒸馏通过教师生成的推理轨迹有效地将领域专业知识转移到学生模型。然而,当这些专家仅通过问答对训练而没有显式推理监督时,是什么决定了它们生成的轨迹?在这项工作中,我们展示了专家优化会隐式地从这个潜在轨迹空间中选择。为了隔离和观察这个潜在分布,我们利用学生蒸馏作为探针,而不是下游目标——因为学生从专家那里继承没有参数化或优化约束,只继承采样的轨迹本身。通过这个探针,我们的经验分析揭示了一个紧密的控制关系:在27个专家-学生配对中,他们的专业化-泛化配置文件显示出极强的相关性。关键的是,显式控制专家的分布漂移会系统地改变教师及其蒸馏学生,在领域精确性和通用能力保持之间的可控权衡上。在化学、物理和多语言环境中,蒸馏学生系统地反映了这些专家诱导的配置文件,即使在不同的模型家族之间。我们的发现建立了专家训练的新视角:当黄金推理缺失时,调优选择直接控制传递给下游模型的潜在监督。
查看缓存全文
缓存时间: 2026/09/15 08:51
# 无需推理轨迹的专业模型训练用于领域专家蒸馏
来源:https://arxiv.org/html/2609.13770
Yilei Tu††注:工作在 Shanghai人工智能实验室实习期间完成。Zihao Li,所属机构:赫尔辛基大学,邮箱:[zihao\.li@helsinki\.fi](mailto:)Shaoxiong Ji,所属机构:ELLIS Institute Finland,所属机构:图尔库大学,邮箱:[shaoxiong\.ji@utu\.fi](mailto:)Jörg Tiedemann,所属机构:赫尔辛基大学,邮箱:[jorg\.tiedemann@helsinki\.fi](mailto:)Fei Yuan,所属机构:上海人工智能实验室,邮箱:[feiyvan@163\.com](mailto:)
###### 摘要
专业蒸馏通过教师生成的推理轨迹,有效地将领域专业知识迁移至学生模型。然而,当这些专业模型仅基于问答对进行训练,而无显式推理监督时,是什么决定了它们生成的轨迹?在本研究中,我们表明专业模型的优化过程隐式地从这个潜在轨迹空间中进行选择。为了隔离并观察这个潜在分布,我们利用学生蒸馏并非作为下游目标,而是作为一种无关探针——因为学生模型不继承专业模型的任何参数化或优化约束,仅继承采样的轨迹本身。通过此探针,我们的实证分析揭示了一种紧密的控制关系:在27组专业-学生配对中,它们的专业化-泛化轮廓表现出异常强的相关性。至关重要的是,显式控制专业模型的分布漂移,能系统地使教师及其蒸馏学生沿着领域精度与通用能力保留之间的可控权衡进行移动。在化学、物理和多语言环境中,蒸馏学生系统性地反映了这些专业模型诱导的轮廓,即使跨越不同的模型家族。我们的发现确立了专业训练的新视角:当缺少黄金推理轨迹时,调优选择直接控制了传递给下游模型的潜在监督。代码[1]、模型和数据集[2]已公开发布。
**[1]** https://github.com/CONE-MT/DCO/tree/main/specialist_distillation
**[2]** https://huggingface.co/collections/yileitu/qaonly-specialist-distillation
## 1 引言
专业蒸馏(Hinton et al., 2015;Fu et al., 2023;Hsieh et al., 2023;Ho et al., 2023;Magister et al., 2023;Yao et al., 2021;Liu et al., 2024)通过一个中间专业模型来迁移领域专业知识。一个通用的初始模型 πθ(例如,Qwen3-8B-Instruct(Yang et al., 2025))首先被适应到目标领域,然后生成的专业模型会生成推理轨迹,作为下游学生的监督信号(Mukherjee et al., 2023;Xu et al., 2024)。然而,在大多数专业领域中,专业模型本身从未被显式地教导如何推理。领域数据集通常提供(q, a)问答对(Uesato et al., 2022;Chan et al., 2022;Lightman et al., 2024;Turpin et al., 2023),但没有黄金轨迹(Zelikman et al., 2022;Gülçehre et al., 2023;Singh et al., 2024),因为专家推理难以获取和验证。由于专业模型仅针对最终答案进行优化,那么是什么决定了它生成的轨迹呢?让 τ 表示为问题 q 生成的自由运行推理轨迹。我们考虑了代表性行为,包括一条实质性的、与答案一致的路径(Creswell and Shanahan, 2022;Turpin et al., 2023, τ+),一条捷径(Geirhos et al., 2020, τ∼),以及一条空轨迹(τ∅)。标准的教师强制 QA 训练直接优化答案似然度,并不显式监督这些轨迹。然而,在生成时,训练后的模型会诱导出这些轨迹上的分布。从概念上讲,logπθ(a|q)=log∑τ→a πθ(τ|q),(1) 其中 τ→a 表示与答案 a 兼容的轨迹。公式(1)刻画的是生成时的行为,而非实际实现的 SFT 目标。由于答案级别的监督在 {τ+, τ∼, τ∅, ...} 之间没有提供直接偏好,因此多个轨迹分布可能仍然与同一受监督的答案兼容。
为了隔离并观察这个潜在选择,我们将学生蒸馏重新定位为一种无关探针,而不仅仅将其视为下游目标。学生既不继承专业模型的参数,也不继承用于获得这些参数的优化约束;它只接收专业模型生成的监督。在我们受控的流程中,学生共享相同的初始化和训练配置,并在相等数量的采样和过滤数据上进行训练。因此,学生之间的差异揭示了这些推理轨迹实际承载的内容,即使学生从未直接接收专业模型的参数或优化约束。通过此诊断探针,我们揭示了专业模型与其蒸馏学生之间的紧密联系。在化学、物理和多语言基准测试中,专业模型在领域专业化与通用能力之间的平衡会系统性地转移给其下游学生。在覆盖27项不同评估的九组专业-学生配对中,这些性能轮廓高度吻合(Spearman ρ=0.9573,置换检验 p-值=0.0093,详见§4.2)。这种模式即使在教师和学生模型属于完全不同的模型家族时也成立,表明观察到的转移并不需要共享的师生参数化。因此,蒸馏学生揭示了专业模型优化选择的潜在监督如何塑造下游能力轮廓。
至关重要的是,这一选择过程既可观察又可控。限制专业模型偏离其原始基础模型的程度,可以直接重新校准其在领域掌握与通用能力之间的权衡,并引导学生模型随之调整。层级选择性微调(LST)(Gao et al., 2025)提供了一个隐式锚点,产生更低的 KL 散度和比标准全参数微调更好的推理结构保留。为了进行显式控制,锚定监督微调(ASFT)(Zhu et al., 2026)提供了一种互补的显式干预:改变其锚定强度会系统地使专业模型和学生沿着相同的权衡轴移动。总而言之,这些结果确定了分布漂移是传递给下游模型的潜在监督的一个可控轴。我们的主要贡献是:
- • **专业模型优化是蒸馏数据的关键设计变量。** 在仅使用 QA 的训练下,推理轨迹仍然由答案标签欠定;专业模型的优化过程从生成下游监督的轨迹分布中进行选择。
- • **蒸馏学生揭示了其专业模型选择的监督。** 利用学生蒸馏作为无关探针,我们揭示了跨领域和模型家族的专业模型和学生模型在专业化-泛化轮廓之间的强对应关系。这种继承表明,专业模型优化的效果被编码在生成的轨迹中并传递到下游,而不是局限于专业模型的参数内。
- • **我们系统地表征并控制了由此产生的专业化-泛化权衡。** 通过受控蒸馏实验、轨迹质量分析,以及无约束微调、隐式漂移控制(LST)和显式 KL 锚定(ASFT)之间的比较,我们确定了分布漂移是潜在监督的控制轴。改变这一漂移可以引导专业模型及其学生在领域精度和通用能力保留之间进行调整。
## 2 相关工作
##### 专业蒸馏与领域适应。 将通用模型适应到专业领域面临成本、延迟和数据稀缺等挑战,这推动了专业蒸馏和领域适应。早期工作比较了“先蒸馏后适应”与“先适应后蒸馏”,表明在进行与任务无关的蒸馏之前,将教师和学生都适应到目标领域,可以得到保留领域专业知识的紧凑模型(Yao et al., 2021)。近期的 LLM 流程,包括 DeepSeek-V3.2(DeepSeek-AI, 2025)和 Qwen3.5-Omni(Qwen-Team, 2026),同样训练领域特定专家并将其能力蒸馏回通用模型;Li et al.(2024)进一步提出了一个从外部监督走向自主改进的分阶段专家增长框架。其他工作专注于构建和利用高质量的领域监督。合成查询生成已被用于蒸馏轻量级检索重排序器(Saad-Falcon et al., 2023),而知识层次结构指导了生物医学 QA 的文献数据蒸馏(Cai et al., 2025)。在蒸馏过程方面,Xia et al.(2026)使用对比自蒸馏将 LLM 推理路径迁移到 BERT,而无需在推理时进行显式推理;Liu et al.(2024)则根据跨领域的师生性能差距调整蒸馏数据的组合。与这些研究不同,我们专注于仅使用 QA 的专业蒸馏中的轨迹层面模糊性,其中专业模型优化隐式地塑造了最终模型继承的轨迹分布。
##### LLMs 中的自蒸馏。 自蒸馏使用模型自身的输出或内部分布作为监督。Yang et al.(2024)在微调前将原始响应重写为模型自身的分布,以缓解灾难性遗忘同时保持对齐。类似地,Shenfeld et al.(2026)从同一模型构建演示条件化的教师,并通过在策略反向 KL 进行蒸馏,用于无需奖励工程的持续技能获取。对于复杂推理,Zhao et al.(2026)使用同一模型作为特权教师和学生,为学生自身的展开提供密集的逐 token 监督。在多语言环境中,Zhang et al.(2024)蒸馏资源丰富的语言响应,以在保持源语言性能的同时提高跨语言能力。对于代码生成,Zhang et al.(2026)仅在采样解决方案上进行微调,表明即使是最小的自蒸馏也能通过重塑模型输出分布来提高性能。我们的工作补充了这一文献,研究了仅使用 QA 的专业优化如何决定传递给下游的潜在推理监督。
## 3 仅使用 QA 的专业蒸馏作为轨迹分布选择
专业蒸馏通常指一个两阶段的训练流程。从初始模型 πθ₀ 开始,首先获得一个适应到目标领域的中间模型 πθ₁。然后使用这个中间模型为最终模型 πθ'₀ 生成训练数据,最终模型通常从同一初始模型 πθ₀ 初始化。在本节中,我们从轨迹学习的角度研究专业蒸馏(见§3.1)。令人惊讶的是,我们发现适当控制专业模型的优化,可以在仅使用 QA 的监督下诱导出高质量的推理轨迹(见§3.2)。
### 3.1 从仅使用 QA 的监督到专业蒸馏中的轨迹学习。
##### 仅使用 QA 的监督欠定诱导的轨迹分布。 在许多领域特定任务中,数据集 D 仅包含问答对 (q, a),而没有推理轨迹 τ。在我们的实现中,专业模型通过标准教师强制 SFT 在问答对 (q, a) 上训练;它不相似文章
LARK:基于可学习性的轨迹选择方法用于高效推理蒸馏
LARK提出了一种基于可学习性的推理轨迹选择方法,用于大语言模型蒸馏。该方法采用可学习性因子和χ²正则化选择策略,平衡效率与泛化能力,在多个模型和任务上持续优于基线方法。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。
通过混合层蒸馏和关键信息的逐步注意力改进小模型的推理能力
本文提出一种新颖的思维链蒸馏框架,通过混合层模块的动态层对齐,将教师模型对关键信息的逐步注意力转移到学生模型中。该方法通过明确指导学生模型在推理过程中逐步聚焦关键信息,在数学和常识推理基准测试中实现了一致的性能提升。
中期训练中的知识蒸馏更倾向于推理而非事实回忆
本文介绍了Switch Distillation,这是一种新颖的中期训练目标,基于教师置信度选择性地应用知识蒸馏,以在较小的语言模型中改善推理并保留事实回忆。
提示级蒸馏:一种高效推理的非参数化模型微调替代方案
提示级蒸馏(PLD)从教师模型中提取推理模式,转化为结构化指令用于学生模型的系统提示,在不增加微调开销的情况下提升推理任务性能。