跨空间蒸馏:用现代扩散教师模型训练单步学生模型
摘要
介绍跨空间蒸馏,这是一种通过轻量级潜在接口Bridge,将知识从现代高容量扩散模型迁移到具有不同潜在空间的紧凑学生模型的方法,无需修改学生主干即可实现质量提升。
查看缓存全文
缓存时间: 2026/07/09 07:51
论文页面 - 跨空间蒸馏:借助现代扩散教师训练单步学生模型
来源:https://huggingface.co/papers/2606.32020 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
跨空间蒸馏通过一个轻量级的潜在接口对齐不同的VAE空间,实现从高容量扩散模型向紧凑学生模型的高效知识迁移。
现代单步扩散模型(https://huggingface.co/papers?q=diffusion%20models)通过基于分布的步长蒸馏(https://huggingface.co/papers?q=timestep%20distillation)取得了令人印象深刻的生成质量。然而,它们依赖一个关键假设:教师与学生必须处于同一潜在空间(https://huggingface.co/papers?q=latent%20space)。这种共享空间约束阻碍了知识从现代高容量教师(例如SD 3.5和Flux)向紧凑、易于部署的学生(例如SD 1.5)迁移,因为后者的潜在分辨率和VAE参数化与教师不同。我们正式将这种被忽视的场景定义为跨空间蒸馏(https://huggingface.co/papers?q=Cross-Space%20Distillation),其中教师与学生在潜在分辨率和VAE空间(https://huggingface.co/papers?q=VAE%20space)上均存在差异。为在这种不匹配条件下实现蒸馏,我们引入了桥接器(https://huggingface.co/papers?q=Bridge),一种轻量级潜在接口(https://huggingface.co/papers?q=latent%20interface),它能够将学生潜在表示映射到教师空间,同时无需修改学生主干网络。桥接器(https://huggingface.co/papers?q=Bridge)结合了冻结的学生VAE解码器(作为空间先验)与一个紧凑的可学习投影器,并通过潜在重建(https://huggingface.co/papers?q=latent%20reconstruction)和注意力保真度(https://huggingface.co/papers?q=attention%20fidelity)目标进行训练,以实现稳定的教师空间对齐。在多种现代教师模型上,桥接器(https://huggingface.co/papers?q=Bridge)使紧凑的单步学生模型获得了显著提升;例如,它将SD 1.5的HPSv3从5.4提升至9.4,同时保持单步推理、低延迟和广泛的生态兼容性。这些结果表明,异构的大规模教师模型可以通过轻量级潜在空间接口蒸馏到高效、可部署的主干网络中。
查看arXiv页面(https://arxiv.org/abs/2606.32020)查看PDF(https://arxiv.org/pdf/2606.32020)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.32020)
引用该论文的模型0
暂无模型关联该论文
在模型 README.md 中引用 arxiv.org/abs/2606.32020 即可从本页面链接。
引用该论文的数据集0
暂无数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2606.32020 即可从本页面链接。
引用该论文的Spaces0
暂无Space关联该论文
在Space README.md 中引用 arxiv.org/abs/2606.32020 即可从本页面链接。
包含该论文的收藏0
暂无收藏包含该论文
将该论文添加到一个收藏(https://huggingface.co/new-collection),即可从本页面链接。
相似文章
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
基于轨迹的在策略蒸馏用于掩码扩散语言模型
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
通过混合策略蒸馏进行推理压缩
本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。