Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型
摘要
Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。
查看缓存全文
缓存时间: 2026/08/05 05:44
论文页面 - Any-OPD: 异构同策略蒸馏用于流匹配模型,基于表示空间桥接
源:https://huggingface.co/papers/2608.03316 发布于 8 月 4 日
·
提交者:https://huggingface.co/simingfu
fu (https://huggingface.co/simingfu) 于 8 月 5 日
摘要
同策略蒸馏(on-policy distillation)中,教师模型会纠正学生模型自身生成的样本,其前提是这两个模型使用相同的“语言”:相同的 VAE 潜空间、匹配的架构,以及共同的时间步网格。我们探究当这些条件都不成立时会发生什么,例如当可用的最强教师模型与期望部署的学生模型来自不同的模型家族时。我们发现标准方案无解:教师潜变量无法在外部坐标系中作为目标;针对随机重绘局部细节的教师模型计算逐像素损失会退化为模糊或发散;时间步索引在不同调度不匹配时也失去意义。我们提出 Any-OPD,据我们所知,这是首个在任意潜空间流匹配生成器对之间进行同策略蒸馏的框架。Any-OPD 将教师模型纯粹视为黑盒采样器,并仅在一个点上连接两个模型:一个冻结的、与模型无关的视觉表示,在此表示中比较它们独立解码的输出,从而绕过了关于潜变量、特征或架构的每一个假设。轨迹对应关系通过匹配连续噪声水平而非步进索引来恢复;一个简短的锚定阶段(教师样本通过学生自己的 VAE 重新编码)确保同策略梯度衡量的是样本质量而非域不匹配。将 12B 的 FLUX.1-dev 蒸馏到 2.5B 的 SD3.5-Medium,Any-OPD 将学生的 PickScore 从 0.846 提升到 0.884,HPSv3 从 9.12 提升到 10.97,以其五分之一的规模媲美教师,而直接潜变量回归则完全无法训练。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03316) 查看 PDF (https://arxiv.org/pdf/2608.03316) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03316)
在你的 agent 中获取此论文:
hf papers read 2608\.03316
没有最新的 CLI?curl -LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2608.03316 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.03316 以从此页面链接它。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2608.03316 以从此页面链接它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
Flow-OPD:用于流匹配模型的对策蒸馏
Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。
Poly-OPD:面向能力可选的流模型的异构多教师同策略蒸馏
Poly-OPD 是一个框架,用于将异构文生图流模型的互补优势蒸馏到一个紧凑的流匹配学生模型中,通过像素桥和梯度兼容适配器实现。它在提升 GenEval 和 DrawBench 得分的同时,整合了多个教师模型的能力。
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
AnyFlow:基于在策略流图蒸馏的任意步长视频扩散模型
AnyFlow 提出了一种新颖的任意步长视频扩散蒸馏框架,通过流图过渡学习和反向模拟优化完整的 ODE 采样轨迹,在匹配甚至超越基于一致性模型的同时,能够随采样步数预算进行扩展。
Flow-DPPO: 针对流匹配模型的散度近端策略优化
Flow-DPPO 在流匹配模型中使用散度近端约束替代比率裁剪,通过精确计算 KL 散度,提升了训练稳定性与多目标优化效果。