Poly-OPD:面向能力可选的流模型的异构多教师同策略蒸馏
摘要
Poly-OPD 是一个框架,用于将异构文生图流模型的互补优势蒸馏到一个紧凑的流匹配学生模型中,通过像素桥和梯度兼容适配器实现。它在提升 GenEval 和 DrawBench 得分的同时,整合了多个教师模型的能力。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - Poly-OPD:面向能力可选择的流模型的异构多教师在策略蒸馏
来源:https://huggingface.co/papers/2608.04349 发布于 8 月 5 日
· 提交者:fu 于 8 月 6 日
作者:
,
,
,
摘要
主流的开源文生图模型往往具有互补的优势:一个可能在偏好对齐的美学方面领先,而另一个则更忠实地遵循组合指令。然而,它们在自编码器和噪声调度上的差异使得这些优势难以在模型间迁移。在本文中,我们提出了 Poly-OPD,一个能够将异构教师的互补优势整合到单一紧凑的流匹配学生模型中的框架。为了弥合不同教师之间不兼容的潜在空间,Poly-OPD 通过像素桥执行在策略蒸馏。每张学生生成的图像都会被所选教师的编码器重新编码,并在该教师的噪声调度下,从幅度匹配的噪声水平开始进行细化。得到的目标进一步在冻结的 DINOv2 空间中与学生匹配,从而在不兼容的潜在空间之间实现监督。为了在无跨教师干扰的情况下保留互补能力,Poly-OPD 使用梯度兼容性诊断来组织其适配器:注意力 LoRA 模块在教师之间共享,而前馈适配器则保持教师特定。在蒸馏过程中,一个感知差距的课程将更多训练分配给学生仍落后于教师的组合类别。随着每个差距缩小,训练转向剩余差距更大的类别。通过将 FLUX.1-dev 和 Z-Image 蒸馏到 2.5B SD3.5-Medium 学生模型中,Poly-OPD 将 GenEval 从 67.3 提高到 73.3,超越了两个更大的教师,并将 DrawBench HPSv3 从 9.34 提升到 11.35,在一个可切换模型中整合了两种优势。
查看 arXiv 页面 (https://arxiv.org/abs/2608.04349) 查看 PDF (https://arxiv.org/pdf/2608.04349) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04349)
在您的智能体中获取此论文:
hf papers read 2608\.04349
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2608.04349,以便从此页面链接到它。
引用此论文的数据集 0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2608.04349,以便从此页面链接到它。
引用此论文的 Spaces 0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2608.04349,以便从此页面链接到它。
包含此论文的集合 0
没有包含此论文的集合
将此论文添加到集合 (https://huggingface.co/new-collection) 中,以便从此页面链接到它。
相似文章
Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型
Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。
Flow-OPD:用于流匹配模型的对策蒸馏
Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。
OPD-V:具有模态平衡的视觉在策略自蒸馏
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。