不同教师,不同能力:面向结构化文本增强的Sub-1B端侧蒸馏
摘要
本文探索将大型推理教师模型(8B)蒸馏为小型学生模型(0.6B),用于端侧结构化文本增强,在实现大幅加速的同时恢复了显著的质量。研究发现,教师模型的推理能力而非其规模推动了摘要质量的提升,但同等规模的指令教师在某些文章上能产生更忠实的输出。
arXiv:2607.08268v1 公告类型:新
摘要:大规模结构化提取在每项任务上都需承担大型模型的延迟开销,因此将任务蒸馏到小型端侧模型颇具吸引力:以极小的时间和成本获得可比输出。我们逐子任务衡量了该蒸馏的实际效果。每篇新闻文章被映射为一个包含简短摘要和五个分类标签的JSON对象。我们将一个8B推理教师模型(deepseek-r1:8b)蒸馏为一个0.6B学生模型(Qwen3-0.6B;使用QLoRA,三个随机种子),并添加两个教师对照组:一个同等规模的非推理教师和一个更大的托管流水线。一个盲审、无参考、三人评审组对每个分支相对于完整文章进行评分,同时设置两个非蒸馏基线:少样本提示和约束解码。学生模型每篇文章处理时间约0.8秒,而教师模型需39秒,在摘要质量上恢复了基准到教师差距的58%,以+16.8分击败其主要基线(约束解码),并以次要+4.9分击败少样本提示。同等规模的非推理教师训练出的学生模型表现不优于未调优的基准,因此摘要质量的提升源于教师的推理特性而非其规模。不同教师的能力随之分化:推理教师传递写作质量,托管流水线传递标签多样性,而同等规模指令教师的学生在93项测试集中的22篇短小、信息薄弱的文章上更贴近原文(忠实输出74篇对比55篇),推理谱系的学生则出现捏造。这种贴近差异是一种一致排序而非显著的整体效应,且子集较小,故我们将其作为方向性发现报告。由于没有单一引擎在所有领域都胜出,最终交付成果是一个面向端侧增强的按字段路由图谱。
查看缓存全文
缓存时间: 2026/07/10 06:08
# 不同教师,不同能力:面向结构化文本增强的低于1B参数设备端蒸馏技术 来源:https://arxiv.org/html/2607.08268 作者:Vinay Kumar Chaganti(独立研究者,邮箱:[email protected])。评估代码、图表生成脚本及部分手稿由AI智能体辅助完成;详见致谢部分。 ###### 摘要 高吞吐量的结构化抽取任务若对每一条数据都使用大模型推理,会产生显著延迟。因此,将任务蒸馏到小型设备端模型颇具吸引力:能以极短的时间和极低的成本获得可比的输出。本研究衡量了这种蒸馏在每个子任务上的实际效果。每篇新闻文章被映射为一个JSON对象,包含一段简短摘要和五个分类标签。我们将一个80亿参数的推理型教师模型(deepseek-r1:8b)蒸馏为一个6亿参数的学生模型(Qwen3-0.6B;采用QLoRA,三个随机种子),并设置两个教师对照组:一个同尺寸的非推理型教师模型,以及一个更大的托管式流水线。采用盲评、无参考、三人评审组,每篇完整文章对所有模型分支进行评分,同时设置两个非蒸馏基线:少样本提示和约束解码。学生模型处理每篇文章约需0.8秒,而教师模型需39秒。在摘要质量上,学生模型恢复了从基础模型到教师模型差距的58%,比其主要基线(约束解码)高出16.8个点,比少样本提示基线再高4.9个点。同尺寸的非推理型教师模型训练出的学生模型性能并不优于未调优的基础模型,因此摘要质量的提升源于教师模型的推理特性,而非其规模。随后,不同教师模型展现出能力分化:推理型教师模型传递了写作质量,而托管式流水线传递了标签多样性;在包含93项测试集的22篇简短、信息量少的文章中,同尺寸指令型教师模型的学生模型更忠于原文(74篇忠实 vs 55篇),而源自推理型教师模型的学生模型则存在捏造现象。这种忠实性差异是一种一致性的排序趋势,而非显著的聚合效应,且子组规模较小,因此我们将其作为一个研究方向。由于没有任何单一模型能在所有领域获胜,最终产出一个按领域划分的设备端增强路由图。 ## I引言 高吞吐量的结构化抽取是一种常见的生产模式:一个提示词,每条数据生成一个符合模式的JSON对象,对数千条数据重复执行。它应用于工单分类、日志分类、文档录入、内容审核预过滤器以及目录抽取。若使用中型或大型模型运行,每条数据都需要承受该模型的延迟。将任务蒸馏到小型设备端模型,有望以更快的速度和更低的成本获得可比的输出。本文衡量了这种蒸馏在每个子任务上,相对于实践者通常会首先尝试的更廉价替代方案的实际效果。 我们研究的实例是新闻增强。每篇文章被映射为一个JSON对象,包含一段简短摘要和五个封闭词汇标签:*情感倾向*、*紧迫性*、*框架*、*语气*和*深度*。一个80亿参数的推理型教师模型(deepseek-r1:8b)能产生可接受的输出,但处理每篇文章约需39秒,因此在消费级笔记本上处理500条数据批次需运行5.4小时。一个6亿参数的模型速度快约40倍,且能适配设备端;开放性问题在于其质量。蒸馏能将小模型的输出向教师模型靠拢,我们探究的是它在每个子任务上恢复了多少质量,以及它是否保持了忠实性——这是面向用户的流水线绝不能妥协的特性。之所以按子任务报告,是因为每个子任务的失败成本不同:单一的聚合结果会掩盖那些回归不可接受的维度。 所有受测模型均在本地运行。在温度为0时使用固定权重,可确定性且无限次重复运行,因此测量结果稳定,所有报告的数字均可离线重新计算。仅评审组和更大的第三方教师模型为托管模式。 研究结论是按字段给出,而非单一结论。蒸馏恢复了教师模型的大部分摘要质量,并击败了两种非蒸馏基线。同尺寸非推理型教师模型对照实验表明,这种提升源于教师模型的推理特性,而非其规模:一个同等尺寸的非推理型教师模型训练出的学生模型,性能并不优于未调优的基础模型。随后,不同教师模型展现出能力分化。推理型教师模型传递了写作质量;更大的托管式流水线传递了标签多样性;而在信息量较少的来源上,同尺寸指令型教师模型的学生模型更忠实于原文,推理型教师模型的学生模型则存在捏造,尽管这最后一个效应是一种一致性的排序趋势,而非显著的聚合差异。短篇文章对几乎所有质量维度上的学生模型都是挑战,而信息量较少来源的忠实性发现仅基于93篇测试文章中的22篇,因此我们将其视为一个研究方向。最终产出的是一个按字段划分的路由图,而非一律推荐使用小模型。 评估体系设计注重鲁棒性。使用93篇预留文章;十二个模型分支,涵盖三个蒸馏教师模型、两种非蒸馏基线以及未调优的基础模型;三个训练种子;一个经阴性对照验证的家族无关三人评审组;以及配对自举显著性检验。 我们的贡献(以发现为先)是:(1) 一个同尺寸非推理型教师模型对照实验,将教师模型的推理特性与其规模分离开,表明摘要质量的提升依赖于前者,且这种提升不延伸至忠实性;(2) 三个教师模型之间的能力分化:推理型教师模型传递写作质量,带有合成数据的规模性传递标签多样性,而同尺寸指令型教师模型在信息量较少来源上保持忠实性(作为一种一致但非显著的排序趋势),这些都无法通过单一聚合分数揭示;(3) 一个按字段划分的设备端增强路由图;(4) 一个完全本地化、无参考、无需人工的评估框架(分解式二元核查清单、向教师模型的差距闭合报告、两种非蒸馏基线、一个阴性对照以及一个基于完整来源的忠实性评分结果),其指标可根据已发布的评分卡离线复现。 我们明确说明研究边界:不存在人工标注的真实标签;三人评审组无法使评估结果完全不受评审模型影响;分类精度是针对评审组共识而非真实情况进行测量。相关问题在X节中汇总。 ## II相关工作 蒸馏到小型设备端模型。训练小型学生模型模仿大型教师模型可追溯到Hinton等人[1],Kim和Rush提出了用于生成的序列级蒸馏[2];现代黑盒变体则是在大模型输出上监督小模型[3,4]。低于10亿参数的设备端模型现在已成为一个明确的设计目标[5,6],而蒸馏是实现其能力的标准途径[7]。与本研究最相关的是针对结构化抽取的定向蒸馏:UniversalNER将LLM蒸馏为小型开放NER学生模型[8],以及一个蒸馏过的生物医学抽取器在尺寸大幅缩小的情况下超越了其教师模型[9]。大多数此类工作报告单一的聚合质量差异;本研究则按子任务分解,并增加了非蒸馏对照,因此蒸馏仅在更廉价的手段无法提供的方面才被赋予功劳。 选择哪个教师模型,以及推理是否有帮助?DeepSeek-R1[10]展示了推理能力可转移到较小的密集模型,引发了一系列在1.5B至32B规模上关注数学、代码和推理基准的重现研究[11,12],而非本文研究的非推理性生产任务。一个更强或具有推理能力的教师模型是否有帮助存在争议。对照研究发现,决定学生模型收益的是教师模型的任务适配度,而非基准分数[13];蒸馏能改善学生模型的输出,但无法传递教师模型的保真度[14];教师模型规模存在最优值而非最大值[15];教师与学生之间差距过大反而会降低学生模型性能[16]。在简单输入上,推理甚至可能产生负面效果:过度思考和思维链开销会通过蒸馏传递[17,18,19],而以推理为导向的训练可能*增加*幻觉[20]。本研究仅使用教师模型的最终答案进行训练(禁用思考过程),这是部署时现实的方案;理由监督[21]留待未来工作。据我们所知,现有工作尚未通过一个同尺寸的非推理型教师模型对照实验,在一个非推理型结构化任务上分离教师模型的推理特性,这正是VI-D节所做的工作。 合成数据蒸馏。托管式流水线分支使用合成数据扩展其训练数据,这一思路源自Self-Instruct[22]到近期将蒸馏中合成数据的贡献分离出来研究的工作[23]。 小型和压缩摘要模型中的忠实性。本研究中更小、非推理型教师模型系的学生模型最为忠实于原文,这一点呼应了一个违反直觉的先前发现:剪枝后的模型可能*减少*幻觉,更倾向于依赖来源[24]。忠实性也随输入特征而变化[25],并且更多地与指令微调而非模型规模相关[26],这与下文报告的信息量较少来源和教师模型特性效应一致。设备端服务会对模型进行量化[27,28];本研究中每个分支都在其部署时的4位量化下进行测量。 LLM作为评审以及评审组。标量LLM评审存在位置偏好、篇幅偏好和自偏好等偏差,并在接近上限时饱和[29,30,31,32]。两种回应塑造了本评估框架。分解:二元核查清单和分解后需求的通过率比0-5分制更可靠[33,34,35]。以及用评审组替代单一评审:由不同模型组成的评审组能减少模型内部偏差,且比一个大型评审模型更接近人类判断[36];集成式评审比过于自信的单一评审校准得更好[37]。由于评估者倾向于自己的和同族的生成结果[38,39],本研究的评审组排除了教师模型和学生模型所在的模型家族。忠实性基于来源进行无参考评分,这与原子事实和蕴涵检查器[40,41]以及基于输入而非真实参考评分的无参考指标[42]相关,并且不同于基于一致性的检测方法[43],后者不使用原始来源。模式约束生成基准测试评估JSON有效性[44],但未评估内容正确性,这正是本内容评分所填补的空白。 被蒸馏的模型是什么。deepseek-r1:8b是DeepSeek-R1-Distill-Llama-8B,它本身是从671B参数的R1模型蒸馏而来[10];Qwen3-0.6B本身也是一个蒸馏产物[5]。因此整个流水线是三级蒸馏,我们推测这有助于解释可达到的天花板,尽管学生模型0.6B本身的容量同样是一个可能的约束条件(X节)。 ## III结构化增强任务 每篇文章被增强为一个包含七个字段的JSON对象:一段自由文本摘要、五个分类标签,以及一个开放集合的话题列表(图1)。代表性的教师模型输出将三到四句的摘要与标签字段配对,例如,*情感倾向*=正面,*紧迫性*=发展中,*框架*=分析性,*语气*=分析性,*深度*=标准,*话题*={AI安全,负责任AI}。 图1:结构化增强任务。每篇文章映射为一个JSON对象,包含一段自由文本摘要、五个分类标签和开放集合的话题。失败成本是不对称的:捏造的摘要会误导人,而错误的标签或话题代价较低。这种不对称性驱动了按字段分配引擎的方案(VIII节)。 分类字段来自从教师模型自身标签中观察到的小型封闭词汇表:*情感倾向*∈{正面,中性,负面};*紧迫性*∈{突发,发展中,常青};*框架*∈{分析型,冲突型,人情味型,经济型};*语气*∈{分析型,乐观型,观点型,警示型};*深度*∈{简要,标准,深度剖析}。教师模型自身的标签分布存在不平衡(例如,*深度*中71%为*标准*,*深度剖析*几乎不存在;完整分布见表II),这对解释每个字段的精度直接相关,并在VI-C节中通过多数类基线具体化。 这个输出实际上包含了两个机器学习问题,具有不同的成功标准(表I):自由文本摘要生成和封闭集合分类。将它们一起评分会掩盖蒸馏带来的具体变化。开放集合话题作为摘要评估规则集内的一项覆盖度检查来报告,不作为第三个子任务,因为没有每个话题的真实标签可供评分。失败成本的不对称性正是本研究结论是“按字段分配引擎”(VIII节)而非单一结论的原因:一个字段必须达到的质量门槛,取决于该字段出现错误所带来的代价。 表I:增强输出是两个具有不同失败成本的子任务 ## IV实验设置 图2:实验流水线。494篇带标签的文章分为401/93两份;三个教师模型——一个80亿参数推理型模型、一个同尺寸80亿参数非推理型模型,以及一个带有合成数据扩展的更大托管式流水线——各自对相同的Qwen3-0.6B基础模型进行蒸馏。十二个分支(七个蒸馏学生模型、两个80亿参数教师模型、两个非蒸馏控制模型和未调优基础模型)在预留集上生成输出,并由一个盲评的三人评审组根据完整文章对两个子任务进行评分,结果以向教师模型的差距闭合形式报告。 模型。教师模型为DeepSeek-R1 8B (deepseek-r1:8b);学生模型为Qwen3-0.6B。两者均在设备端
相似文章
从大型推理模型到紧凑型学生模型的知识蒸馏:以John O Bryan数学竞赛为例
本文研究了从DeepSeek-R1推理模型到紧凑型Qwen2.5-7B学生模型的知识蒸馏,使用了基于John O'Bryan数学竞赛问题构建的思维链(CoT)语料库。微调后的学生模型在竞赛数据集上取得了4.76个百分点的提升,并泛化到MATH-500,同时还分析了回答长度对推理质量的影响。
通过混合层蒸馏和关键信息的逐步注意力改进小模型的推理能力
本文提出一种新颖的思维链蒸馏框架,通过混合层模块的动态层对齐,将教师模型对关键信息的逐步注意力转移到学生模型中。该方法通过明确指导学生模型在推理过程中逐步聚焦关键信息,在数学和常识推理基准测试中实现了一致的性能提升。
通过混合策略蒸馏进行推理压缩
本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。
如何微调推理模型?一个教师-学生协作框架用于合成学生一致的SFT数据
本文介绍了TESSY,一种用于微调推理模型的教师-学生协作框架。该框架通过将生成过程解耦为能力令牌(来自教师)和风格令牌(来自学生),生成符合在线策略的SFT数据,从而解决了使用离线策略教师数据时的灾难性遗忘问题。
提示级蒸馏:一种高效推理的非参数化模型微调替代方案
提示级蒸馏(PLD)从教师模型中提取推理模式,转化为结构化指令用于学生模型的系统提示,在不增加微调开销的情况下提升推理任务性能。