无数据流自蒸馏用于少步视频生成 —— 在 MiniMax-H3 上开源了经过验证的实现 [P]

Reddit r/MachineLearning 模型

摘要

HyperFlow 是一个开源的 8 步 LoRA,它使用无数据流自蒸馏在 MiniMax-H3 中将视频生成步数从 49 步减少到 8 步,在保持质量的同时实现了显著的加速。

大家好,我是 Yuesong,Video Rebirth 的研究员。我们开源了 HyperFlow,一个用于 MiniMax-H3 的 8 步 LoRA。核心思想:无数据流自蒸馏。Diffusers 的默认采样器进行 49 次模型前向传播;我们训练了一个 LoRA,使模型在 8 步内重现该轨迹。基础模型是唯一的教师——没有外部数据集,没有人工标签。与基础 H3 的比较(未编辑,相同提示,相同种子)—— https://videorebirth.com/lp/hyperflow 我们测量了:相机控制 时间一致性 材质/细节渲染 整体平衡 速度:(相同片段:fl2va,124 帧,1344×768;仅生成时间,不包括启动和权重加载)在 4× H200 上约 60 秒 vs 49 步基础模型的约 175 秒(2.9 倍) 在 1× H200 上使用官方自动 CPU 卸载约 130 秒 vs 约 395 秒(3.0 倍) 结合 Sol-Attn、FlashAttention 和 VAE 并行,可以再加速超过 5 倍。在 8-GPU B200 集群上,它达到实时速度(生成时间少于片段本身的时间)。链接:代码:https://github.com/Video-Rebirth/hyperflow 权重:https://huggingface.co/videorebirth/hyperflow 演示比较:https://videorebirth.com/lp/hyperflow 此模型是 MiniMax-H3 的衍生品,根据 MiniMax H3 社区许可证协议发布。请在使用前仔细阅读许可证,特别是地域限制和可接受使用政策。已知限制:它是 H3 的少步蒸馏版:请在自己的提示(相同种子)上与基础模型比较 提示跟随性、语言、偏见和失败模式是基础模型的 不是通用 LoRA。它需要 HyperFlow 加载器,而不是标准 LoRA 加载器 开源版本支持 768p 推理分辨率 MiniMax H3 社区许可证排除美国、欧盟、英国和韩国(继承自基础模型的许可条款) 你最想在哪些用例上尝试这个?如果有人对自蒸馏方法好奇,我很乐意深入探讨技术细节。
查看原文

相似文章