UniSD:面向大型语言模型的统一自蒸馏框架

Hugging Face Daily Papers 论文

摘要

本文提出了 UniSD,这是一种用于适应大型语言模型的统一自蒸馏框架,整合了监督可靠性、表征对齐和训练稳定性的机制。实验结果表明,UniSD 在多个基准测试中均优于基础模型和现有基线方法。

自蒸馏(SD)为在不依赖更强外部教师模型的情况下适应大型语言模型(LLMs)提供了一条有前景的路径。然而,在自回归 LLMs 中应用自蒸馏仍面临挑战,因为自我生成的轨迹是自由形式的,正确性取决于具体任务,且看似合理的推理过程仍可能带来不稳定或不可靠的监督。现有方法主要研究孤立的设计选择,导致其有效性、作用及相互关系尚不明确。在本文中,我们提出了 UniSD,一个用于系统研究自蒸馏的统一框架。UniSD 整合了互补机制以解决监督可靠性、表征对齐和训练稳定性问题,包括多教师一致性、EMA 教师稳定化、token 级对比学习、特征匹配以及散度裁剪。在来自三个模型家族的六个基准和六种模型上,UniSD 揭示了自蒸馏何时优于静态模仿、哪些组件推动了性能提升,以及这些组件在不同任务中如何相互作用。基于这些见解,我们构建了 UniSDfull,这是一个整合互补组件的集成流水线,取得了最强的整体性能,相比基础模型提升了 5.4 分,相比最强基线提升了 2.8 分。广泛的评估强调,自蒸馏是一种实用且可控的方法,可在不依赖更强外部教师模型的情况下高效适应 LLMs。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:22

论文页面 - UniSD:面向大语言模型的统一自蒸馏框架

来源:https://huggingface.co/papers/2605.06597

摘要

自蒸馏框架 UniSD 通过整合监督可靠性、表征对齐和训练稳定性的机制,系统地解决了自回归语言模型适应过程中的挑战。

自蒸馏(https://huggingface.co/papers?q=Self-distillation)(SD)为实现大语言模型(LLM)的适应提供了一条有前景的路径,且无需依赖更强的外部教师模型。然而,在自回归 LLM(https://huggingface.co/papers?q=autoregressive%20LLMs)中进行 SD 仍然具有挑战性,因为自生成的轨迹是自由形式的,正确性取决于任务,且看似合理的推理过程仍可能提供不稳定或不可靠的监督。现有方法主要考察孤立的设计选择,导致其有效性、角色及相互作用尚不明确。在本文中,我们提出了 UniSD(https://huggingface.co/papers?q=UniSD),一个用于系统研究自蒸馏(https://huggingface.co/papers?q=self-distillation)的统一框架。UniSD(https://huggingface.co/papers?q=UniSD)集成了互补机制,以解决监督可靠性、表征对齐和训练稳定性问题,包括多教师共识(https://huggingface.co/papers?q=multi-teacher%20agreement)、EMA 教师稳定化(https://huggingface.co/papers?q=EMA%20teacher%20stabilization)、token 级对比学习(https://huggingface.co/papers?q=token-level%20contrastive%20learning)、特征匹配(https://huggingface.co/papers?q=feature%20matching)和散度裁剪(https://huggingface.co/papers?q=divergence%20clipping)。在来自三个模型家族的六个基准测试和六个模型上,UniSD(https://huggingface.co/papers?q=UniSD)揭示了自蒸馏(https://huggingface.co/papers?q=self-distillation)在何时优于静态模仿、哪些组件推动了性能提升,以及这些组件在不同任务中如何相互作用。基于这些见解,我们构建了 UniSDfull(https://huggingface.co/papers?q=UniSDfull),这是一个集成互补组件的流水线,实现了最强的整体性能,相比基础模型提升了 +5.4 分,相比最强基线提升了 +2.8 分。广泛的评估突出了自蒸馏(https://huggingface.co/papers?q=self-distillation)作为一种实用且可调控的方法,可在没有更强外部教师的情况下高效地适应 LLM。

查看 arXiv 页面(https://arxiv.org/abs/2605.06597)查看 PDF(https://arxiv.org/pdf/2605.06597)添加到集合(https://huggingface.co/login?next=%2Fpapers%2F2605.06597)

在你的 agent 中获取此论文:

hf papers read 2605\.06597

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2605.06597 即可从此页面链接。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.06597 即可从此页面链接。

引用此论文的 Spaces 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2605.06597 即可从此页面链接。

包含此论文的集合 0

没有集合包含此论文

将此论文添加到集合(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

Adaptive Supervised Anchoring for On-Policy Self-Distillation

arXiv cs.LG

This paper proposes an adaptive supervised anchoring framework for on-policy self-distillation, addressing the problem of rollout-conditioned signal degradation in language model training. The method separates rollout-conditioned distribution matching from canonical-context supervision, improving task acquisition while preserving general capabilities.

UNIT: 释放大型语言模型在图持续学习中的潜力

arXiv cs.AI

本文提出UNIT框架,该框架在第一任务上微调大型语言模型以增强其在图持续学习中的适应性,解决了语义-结构分离和知识迁移不平衡的问题。实验表明其达到了最先进的性能。

ReAD:面向大型语言模型的强化引导能力蒸馏

arXiv cs.CL

本文提出了 ReAD,这是一种强化引导的能力蒸馏框架,通过考虑大型语言模型中的跨能力迁移来优化 token 预算。与现有基线相比,该方法在提升下游效用的同时,减少了有害溢出。

MixSD:混合上下文自蒸馏知识注入

Hugging Face Daily Papers

MixSD 提出了一种面向语言模型知识注入的自蒸馏方法,该方法将监督信号与模型自身的原生分布对齐,从而减少微调过程中的灾难性遗忘。它能够实现近乎完美的记忆,同时保留高达 100% 的基础能力,远超标准 SFT。

GDSD:强化学习作为扩散语言模型的引导式降噪器自蒸馏

Hugging Face Daily Papers

GDSD提出了一种强化学习方法,直接从优势引导的自教师中蒸馏扩散语言模型的降噪器,避免了基于ELBO的似然代理带来的偏差。在规划、数学和编码基准上,比先前最先进的方法准确率提升高达+19.6%。