跨空间蒸馏:用现代扩散教师模型训练单步学生模型

Hugging Face Daily Papers 论文

摘要

介绍跨空间蒸馏,这是一种通过轻量级潜在接口Bridge,将知识从现代高容量扩散模型迁移到具有不同潜在空间的紧凑学生模型的方法,无需修改学生主干即可实现质量提升。

现代单步扩散模型通过基于分布的时步蒸馏实现了令人印象深刻的画质。然而,它们依赖一个关键假设:教师和学生必须处于相同的潜在空间。这种共享空间约束阻止了从现代高容量教师(例如SD 3.5和Flux)向紧凑、易于部署的学生模型(如SD 1.5)进行知识迁移,因为后者的潜在分辨率和VAE参数化与教师不同。我们将这一被忽视的场景正式定义为跨空间蒸馏,其中教师和学生在潜在分辨率和VAE空间上均不同。为了在这种不匹配下实现蒸馏,我们引入了Bridge,一个轻量级潜在接口,它可以将学生潜在映射到教师空间,而无需修改学生主干。Bridge将冻结的学生VAE解码器作为空间先验,与一个紧凑的可学习投影仪结合,并通过潜在重建和注意力保真度目标进行训练,以实现稳定的教师空间对齐。在各种现代教师模型上,Bridge为紧凑的单步学生带来了显著提升;例如,它将SD 1.5的HPSv3从5.4提升到9.4,同时保持单步推理、低延迟和广泛的生态系统兼容性。这些结果表明,通过一个轻量级的潜在空间接口,可以将异构的大型教师模型蒸馏到高效、可部署的主干中。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:51

论文页面 - 跨空间蒸馏:借助现代扩散教师训练单步学生模型

来源:https://huggingface.co/papers/2606.32020 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

跨空间蒸馏通过一个轻量级的潜在接口对齐不同的VAE空间,实现从高容量扩散模型向紧凑学生模型的高效知识迁移。

现代单步扩散模型(https://huggingface.co/papers?q=diffusion%20models)通过基于分布的步长蒸馏(https://huggingface.co/papers?q=timestep%20distillation)取得了令人印象深刻的生成质量。然而,它们依赖一个关键假设:教师与学生必须处于同一潜在空间(https://huggingface.co/papers?q=latent%20space)。这种共享空间约束阻碍了知识从现代高容量教师(例如SD 3.5和Flux)向紧凑、易于部署的学生(例如SD 1.5)迁移,因为后者的潜在分辨率和VAE参数化与教师不同。我们正式将这种被忽视的场景定义为跨空间蒸馏(https://huggingface.co/papers?q=Cross-Space%20Distillation),其中教师与学生在潜在分辨率和VAE空间(https://huggingface.co/papers?q=VAE%20space)上均存在差异。为在这种不匹配条件下实现蒸馏,我们引入了桥接器(https://huggingface.co/papers?q=Bridge),一种轻量级潜在接口(https://huggingface.co/papers?q=latent%20interface),它能够将学生潜在表示映射到教师空间,同时无需修改学生主干网络。桥接器(https://huggingface.co/papers?q=Bridge)结合了冻结的学生VAE解码器(作为空间先验)与一个紧凑的可学习投影器,并通过潜在重建(https://huggingface.co/papers?q=latent%20reconstruction)和注意力保真度(https://huggingface.co/papers?q=attention%20fidelity)目标进行训练,以实现稳定的教师空间对齐。在多种现代教师模型上,桥接器(https://huggingface.co/papers?q=Bridge)使紧凑的单步学生模型获得了显著提升;例如,它将SD 1.5的HPSv3从5.4提升至9.4,同时保持单步推理、低延迟和广泛的生态兼容性。这些结果表明,异构的大规模教师模型可以通过轻量级潜在空间接口蒸馏到高效、可部署的主干网络中。

查看arXiv页面(https://arxiv.org/abs/2606.32020)查看PDF(https://arxiv.org/pdf/2606.32020)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.32020)

引用该论文的模型0

暂无模型关联该论文

在模型 README.md 中引用 arxiv.org/abs/2606.32020 即可从本页面链接。

引用该论文的数据集0

暂无数据集关联该论文

在数据集 README.md 中引用 arxiv.org/abs/2606.32020 即可从本页面链接。

引用该论文的Spaces0

暂无Space关联该论文

在Space README.md 中引用 arxiv.org/abs/2606.32020 即可从本页面链接。

包含该论文的收藏0

暂无收藏包含该论文

将该论文添加到一个收藏(https://huggingface.co/new-collection),即可从本页面链接。

相似文章

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

基于轨迹的在策略蒸馏用于掩码扩散语言模型

arXiv cs.CL

一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。

通过混合策略蒸馏进行推理压缩

arXiv cs.AI

本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。