从大型推理模型到紧凑型学生模型的知识蒸馏:以John O Bryan数学竞赛为例

arXiv cs.LG 论文

摘要

本文研究了从DeepSeek-R1推理模型到紧凑型Qwen2.5-7B学生模型的知识蒸馏,使用了基于John O'Bryan数学竞赛问题构建的思维链(CoT)语料库。微调后的学生模型在竞赛数据集上取得了4.76个百分点的提升,并泛化到MATH-500,同时还分析了回答长度对推理质量的影响。

arXiv:2606.31048v1 公告类型:新 摘要:本文研究了从大型推理模型(DeepSeek-R1)到紧凑型学生模型(Qwen2.5-7B)的知识蒸馏。使用北肯塔基大学John O'Bryan数学竞赛(2011-2025)的历史问题,我们通过双智能体框架构建了思维链(CoT)训练语料库。该数据集用于在Apple Silicon硬件上使用MLX框架通过低秩适配(LoRA)微调学生模型。基础Qwen2.5-7B模型在竞赛问题上达到64.67%的准确率,而DeepSeek-R1教师模型达到91.40%。初始的1,000次迭代训练发现严重过拟合,验证损失在第200次迭代时达到最小值后稳步上升。基于此发现,我们运行了五次独立的训练,每次限制200次迭代,使用不同的随机种子以评估结果稳定性。在这五次运行中,微调后的学生模型在竞赛数据集上的平均准确率为69.43%(标准差0.17%),比基础模型提高4.76个百分点,并在MATH-500基准上泛化到73.1%(标准差0.18%)。我们进一步研究了回答长度如何影响六个推理级别(R1-R6)的答案质量:准确率从R1(平均220词)的69.43%持续下降到R6(平均31.2词)的41.9%,其中双人速度部分对令牌缩减最为敏感。这些结果表明,CoT蒸馏改进了紧凑型学生模型,并且回答长度是数学推理质量的关键因素。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:33

# 从大型推理模型到紧凑学生模型的知识蒸馏:以约翰·奥布莱恩数学竞赛为例
来源:https://arxiv.org/html/2606.31048
11institutetext:北肯塔基大学,高地高地,KY 41099,美国
11email:\{baralg1, khanala1, taoy1, zhouj2\}@nku\.edu

###### 摘要

本文研究了从大型推理模型 \(DeepSeek\-R1\) 到紧凑学生模型 \(Qwen2\.5\-7B\) 的知识蒸馏。利用北肯塔基大学约翰·奥布莱恩数学竞赛(2011–2025)的历史题目,我们通过双代理框架构建了一个思维链(CoT)训练语料库。该数据集用于使用MLX框架\[1 (https://arxiv.org/html/2606.31048#bib.bib1)\]在 Apple Silicon 硬件上通过低秩适应(LoRA)微调学生模型。基础 Qwen2\.5\-7B 模型在竞赛题目上达到 64.67% 的准确率,而 DeepSeek\-R1 教师模型达到 91.40%。初始的 1,000 次迭代训练显示出严重的过拟合,验证损失在第 200 次迭代达到最小值,之后稳步上升。基于此发现,我们使用不同的随机种子进行了五次独立的训练,每次限制在 200 次迭代,以评估结果的稳定性。在这五次运行中,微调后的学生模型在竞赛数据集上的平均准确率为 69.43%±\pm0.17%,比基础模型提高了 4.76 个百分点,并在 MATH\-500 基准测试上泛化到 73.1%±\pm0.18%。我们进一步研究了在六个推理等级(R1–R6)下,回复长度如何影响答案质量:准确率从 R1(平均 220 词)的 69.43% 持续下降到 R6(平均 31.2 词)的 41.9%,其中双人速度部分对令牌缩减最为敏感。这些结果表明,CoT 蒸馏改进了紧凑学生模型,并且回复长度是数学推理质量的一个关键因素。

## 1 引言

近年来,具有高级数学推理能力的大型语言模型(LLM)得到了广泛应用。像 DeepSeek\-R1 这样的模型在竞赛级别的数学基准测试中表现出色,但其规模使得本地部署不切实际。知识蒸馏提供了一种解决此问题的方法:通过将大型教师模型的推理行为转移到一个较小的学生模型中,可以生成紧凑的模型,其性能接近教师模型,同时计算成本显著降低\[2 (https://arxiv.org/html/2606.31048#bib.bib2)\]。

尽管最近在从大型模型中蒸馏推理能力方面取得了进展\[3 (https://arxiv.org/html/2606.31048#bib.bib3),4 (https://arxiv.org/html/2606.31048#bib.bib4)\],但大多数研究依赖通用基准测试,如 MATH\-500\[5 (https://arxiv.org/html/2606.31048#bib.bib5)\]或 GSM8K\[6 (https://arxiv.org/html/2606.31048#bib.bib6)\],这些基准可能包含预训练阶段见过的数据。目前尚不清楚蒸馏在领域特定、专家策划且污染风险较低的问题集上表现如何。

本研究通过将知识蒸馏应用于本科数学竞赛题目来填补这一空白,使用北肯塔基大学(NKU)的约翰·奥布莱恩数学竞赛作为我们的问题语料库。该竞赛涵盖多个难度级别和数学主题,使其成为一个焦点明确、定义良好的评估 LLM 推理的数据集。据我们所知,这是首次将 CoT 蒸馏应用于该语料库,并量化令牌预算约束在竞赛风格题目上对六个推理等级影响的研究。

我们的主要贡献如下:(1)我们使用双代理教师-验证器流水线,从 15 年的竞赛题目中构建了一个 CoT 训练语料库;(2)我们证明,结合早停的 LoRA 微调将 Qwen2\.5\-7B 的准确率从 64.67% 提升至 69.43%±\pm0.17%,并泛化到 MATH\-500;(3)我们量化了在六个级别上减少令牌预算时准确率如何下降,识别出多步竞赛题目的实际下限大约为 50–100 词;(4)我们提供了错误类型分析,显示约 40% 的失败是格式错误而非数学错误。

流水线步骤如下。首先,我们收集并数字化了 2011 年至 2025 年的竞赛题目。其次,由 DeepSeek\-R1 API 驱动的双代理框架生成 CoT 推理轨迹并验证答案。第三,使用 MLX 框架通过 LoRA 微调量化后的 Qwen2\.5\-7B 学生模型。一次诊断性的 1,000 次迭代运行确定了最佳早停点,之后使用不同随机种子进行了五次独立的 200 次迭代运行,以产生稳定结果。最后,我们在竞赛数据集和 MATH\-500 上评估微调后的模型,并运行了一个多级令牌预算实验。完整的实现,包括数据准备脚本、微调代码、评估流水线和原始结果文件,可在 https://github.com/TempGaurab/Distillation.John-O-Bryan 公开获取。

## 2 相关工作

### 2.1 知识蒸馏

知识蒸馏由 Hinton、Vinyals 和 Dean\[4 (https://arxiv.org/html/2606.31048#bib.bib4)\] 引入,他们证明较小的网络可以通过在软输出目标上训练来近似较大的集成模型。软目标比独热标签包含更丰富的类间关系信息,有助于学生模型在训练分布之外泛化。Gou 等人\[2 (https://arxiv.org/html/2606.31048#bib.bib2)\] 综述了随后的广泛文献,记录了蒸馏技术如何扩展到涵盖多种模型类型的特征级、基于关系的和任务特定的目标。Boix\-Adsera\[7 (https://arxiv.org/html/2606.31048#bib.bib7)\] 提供了 PAC 理论证明,表明从教师模型训练的学生模型可以实现比仅从原始标签学习更低的样本复杂度。

### 2.2 推理 LLM 的蒸馏

自 2023 年以来,将蒸馏应用于以推理为重点的 LLM 已获得广泛关注。DeepSeek\-R1\[3 (https://arxiv.org/html/2606.31048#bib.bib3)\] 使用强化学习在 MATH\-500 和 AIME 基准测试上达到了最先进的性能,其技术报告表明,蒸馏后的小型变体(例如 DeepSeek\-R1\-Distill\-Qwen\-32B)保留了教师模型的大部分推理能力。Deng 等人\[8 (https://arxiv.org/html/2606.31048#bib.bib8)\] 提出了隐式思维链蒸馏,其中教师推理被编码到学生隐藏状态而非表面文本中,从而在不生成显式中间步骤的情况下提高了 GSM8K 性能。Ho 等人\[9 (https://arxiv.org/html/2606.31048#bib.bib9)\] 表明,在教师生成的 CoT 轨迹上微调较小 GPT\-2 变体,显著提高了多步算术准确性,为推理轨迹是有效训练信号提供了早期证据。Magister 等人\[10 (https://arxiv.org/html/2606.31048#bib.bib10)\] 将这一发现扩展到不同规模的 T5 模型,表明即使是 11B 参数的学生模型也能从小学和符号推理任务上的蒸馏 CoT 监督中受益。参数高效微调方法,如 LoRA\[11 (https://arxiv.org/html/2606.31048#bib.bib11)\] 和前缀微调,已被证明能有效适应特定领域、数据有限的 LLM\[12 (https://arxiv.org/html/2606.31048#bib.bib12),13 (https://arxiv.org/html/2606.31048#bib.bib13)\]。

### 2.3 视觉语言蒸馏

知识蒸馏也已扩展到视觉语言领域。视觉-语言-视觉(VLV)自动编码器框架\[14 (https://arxiv.org/html/2606.31048#bib.bib14)\] 引入了一种经济高效的方法来构建强大的图像描述模型,通过使用冻结的文生图扩散模型作为信息瓶颈,然后微调 LLM 将生成的语言表示解码为详细描述。该方法在训练成本低于 1000 美元的情况下,达到了与 GPT\-4o 和 Gemini 2.0 Flash 相当的性能,表明策略性地重用预训练组件可以显著减少数据和计算需求。这种利用冻结教师模型生成高质量训练信号而无需重新训练的原则,与我们使用 DeepSeek\-R1 作为固定 API 教师模型的做法相似。

### 2.4 回复长度与推理质量

回复长度与模型准确率之间的关系已受到越来越多的关注。Wei 等人\[15 (https://arxiv.org/html/2606.31048#bib.bib15)\] 表明,思维链提示显著提高了多步算术和常识问题的性能,确立了显式中间步骤是有益的而非冗余。推理时计算缩放的结果\[3 (https://arxiv.org/html/2606.31048#bib.bib3)\] 进一步证实,允许模型使用更多令牌进行推理可提高下游任务在困难基准上的准确率。关于结构化中间推理步骤的相关工作,例如 Zhao 等人\[16 (https://arxiv.org/html/2606.31048#bib.bib16)\] 用于形式定理证明的基于子目标演示的学习框架,也表明中间推理步骤的组织结构和粒度会实质性影响下游任务准确率,这促使我们更仔细地研究在令牌预算下压缩这些步骤如何影响性能。我们的令牌预算实验直接在受控的竞赛问题集上,跨六个推理等级测量了这种权衡。

### 2.5 数学基准与竞赛题目

标准基准测试如 MATH\-500\[5 (https://arxiv.org/html/2606.31048#bib.bib5)\] 和 GSM8K\[6 (https://arxiv.org/html/2606.31048#bib.bib6)\] 被广泛用于评估数学推理能力。Lightman 等人\[17 (https://arxiv.org/html/2606.31048#bib.bib17)\] 表明,在人工标注的解题步骤上训练的过程奖励模型在 MATH 上优于结果监督模型,突出了步骤级别监督的重要性。竞赛级问题集提供专家策划、分级难度以及降低的预训练污染风险。约翰·奥布莱恩竞赛在受控的学术环境中提供了这样一个语料库,涵盖代数、微积分、组合学和线性代数,分为三个难度等级。

## 3 系统模型与方法论

### 3.1 理论基础

知识蒸馏训练学生模型 \(f_S\) 逼近教师模型 \(f_T\)。标准目标函数为:

\[
\mathcal{L} = (1 - \alpha) \, \mathcal{L}_{CE} \!\left(y, f_S(x)\right) + \alpha \, \mathcal{L}_{KL} \!\left(f_T(x), f_S(x)\right)
\] (1)

其中 \(\mathcal{L}_{CE}\) 是针对真实标签 \(y\) 的交叉熵损失,\(\mathcal{L}_{KL}\) 是教师和学生输出分布之间的 KL 散度,\(\alpha \in [0,1]\) 平衡两项。由于 DeepSeek\-R1 通过 API 访问且无法获取完整的 logit 分布,我们采用 CoT 蒸馏方法:教师生成逐步推理轨迹,作为学生模型的有监督训练目标。这便将方程 (1) 简化为在教师输出序列上的标准交叉熵微调\[9 (https://arxiv.org/html/2606.31048#bib.bib9)\]。

### 3.2 数据集构建

语料库包含来自约翰·奥布莱恩数学竞赛(2011–2025)的 671 道题目,从官方 PDF 试卷册中通过文本提取和手动数字化相结合的方式提取,以确保 OCR 质量。删除了缺少答案键、图表不清或措辞含糊的题目。数据集按年份进行时间划分:2011–2021 年的题目构成训练集,2022–2023 年构成验证集,2024–2025 年构成保留测试集。这种基于年份的划分防止了阶段间的数据泄露。记录以 JSONL 格式存储,包含字段:`year`、`section`、`question\_id`、`problem` 和 `answer`,并格式化为 MLX LoRA 框架所需的形式。

### 3.3 双代理教师框架

两个 DeepSeek\-R1 代理顺序执行:
1. **代理 1(求解器)**:生成逐步 CoT 响应,以明确分隔的最终答案结束。
2. **代理 2(验证器)**:接收原始题目、真实答案和代理 1 的响应,返回 `CORRECT` / `INCORRECT` 判决及简要理由。

在竞赛数据集(651 题)上,该流水线达到 91.4% 的准确率(594 题正确);在 MATH\-500 上达到 94.0%(470/500)。仅保留验证正确的轨迹作为训练样本。虽然同时使用 DeepSeek\-R1 作为教师和验证器引入了一种依赖性,但验证器会对照独立提供的真实答案检查事实正确性,这在一定程度上缓解了风格偏差。

### 3.4 LoRA 微调配置

学生模型是 4 位量化形式的 Qwen2\.5\-7B\-Instruct。LoRA\[11 (https://arxiv.org/html/2606.31048#bib.bib11)\] 添加秩分解矩阵 \(\Delta W = BA\)(\(B \in \mathbb{R}^{d \times r}\), \(A \in \mathbb{R}^{r \times k}\),且 \(r \ll \min(d, k)\)),同时冻结基础权重。配置:秩 \(r = 8\);\(\alpha = 16\);dropout = 0.05;目标模块 `q_proj`、`k_proj`、`v_proj`、`o_proj`;上下文长度 2,048 个令牌;4 位(Q4)量化。可训练参数:11.534M(占 7,615.617M 的 0.151%),保持参数数量少以限制在紧凑语料库上的过拟合\[13 (https://arxiv.org/html/2606.31048#bib.bib13)\]。

### 3.5 多次运行训练协议

**阶段 1(诊断运行)**:我们使用 `mlx_lm.lora` 运行了 1,000 次迭代,批次大小为 4,学习率为 \(1 \times 10^{-5}\),并启用梯度检查点。验证损失在第 200 次迭代达到最小值 0.374,然后在第 1,000 次迭代时升至 0.826,而训练损失则趋近于零。这确定了第 200 次迭代为最佳早停点。

**阶段 2(五次独立运行)**:五次训练运行,每次限制为 200 次迭代,使用不同的随机种子(42、123、256、512、999)进行权重初始化和数据打乱,所有其他超参数保持不变。每次运行的适配器权重使用 `mlx_lm.fuse` 合并到基础模型中,并分别评估所有五个合并后的模型。每次运行的峰值内存:12.247 GB。

### 3.6 多级令牌预算实验

我们在六个推理等级(R1–R6)上评估了微调后的模型。R1 是无限制的基准线,对应 69.43% 的微调结果。R2 到 R6 逐步应用更小的最大令牌预算:R2(400 令牌)、R3(320 令牌)、R4(180 令牌)、R5(135 令牌)和 R6(100 令牌)。所有级别的正确性均由相同的 DeepSeek\-R1 评判器判断。仅包含已验证真实答案正确(`correct_flag == 1`)的题目参与准确率计算。

## 4 数据集描述

约翰·奥布莱恩数学竞赛每年在 NKU 举行,提供了 15 年间(2011–2025)的 671 道题目。经过筛选,语料库涵盖三个部分:新生/大二(265 题:代数、数论、组合学、微积分先修),大三/大四(268 题:微积分、线性代数、抽象推理),以及双人速度(118 题:快速多步数值推理)。按时间顺序划分训练/验证/测试集(2011–2021 / 2022–2023 / 2024–2025)防止了时间上的数据泄露。每条记录都是一个 JSONL 对象,包含字段 `year`、`section`、`question\_id`、`problem` 和 `answer`;仅使用了教师验证正确的 594 条轨迹进行训练。MATH\-500\[5 (https://arxiv.org/html/2606.31048#bib.bib5)\](500 题,7 个科目)作为外部评估基准。

相似文章

通过混合层蒸馏和关键信息的逐步注意力改进小模型的推理能力

arXiv cs.CL

本文提出一种新颖的思维链蒸馏框架,通过混合层模块的动态层对齐,将教师模型对关键信息的逐步注意力转移到学生模型中。该方法通过明确指导学生模型在推理过程中逐步聚焦关键信息,在数学和常识推理基准测试中实现了一致的性能提升。

通过推理空间压缩的结构化理由蒸馏

arXiv cs.CL

本文提出了 D-RPC,一种通过将推理路径压缩为可复用库,从而将大型语言模型的推理能力蒸馏给较小模型的方法,该方法在数学和常识基准测试中实现了更好的性能和一致性。

更好的起点,更好的终点:压缩推理的自举迭代自推理蒸馏

arXiv cs.CL

提出了BIRD,一种两阶段自推理蒸馏方法,该方法在策略训练之前自举简洁的推理轨迹,在MATH-500和AIME基准测试上实现了更强的精度-效率权衡。在Qwen3-8B上,准确率从86.2%提升至92.0%,同时平均响应长度从3,099个token降至1,115个token。

OmniThoughtVis:一种用于部署型多模态推理模型的可扩展蒸馏流水线

arXiv cs.CL

本文介绍了 OmniThoughtVis,这是一种可扩展的流水线,用于将多模态推理能力从大型教师模型蒸馏到更小、面向部署的多模态大语言模型(MLLMs)中。该方法利用精心策划的思维链(chain-of-thought)数据,显著提升了从2B到8B参数规模模型在 MathVerse 和 MMMU-Pro 等基准测试上的推理性能。