无数据流自蒸馏用于少步视频生成 —— 在 MiniMax-H3 上开源了经过验证的实现 [P]
摘要
HyperFlow 是一个开源的 8 步 LoRA,它使用无数据流自蒸馏在 MiniMax-H3 中将视频生成步数从 49 步减少到 8 步,在保持质量的同时实现了显著的加速。
大家好,我是 Yuesong,Video Rebirth 的研究员。我们开源了 HyperFlow,一个用于 MiniMax-H3 的 8 步 LoRA。核心思想:无数据流自蒸馏。Diffusers 的默认采样器进行 49 次模型前向传播;我们训练了一个 LoRA,使模型在 8 步内重现该轨迹。基础模型是唯一的教师——没有外部数据集,没有人工标签。与基础 H3 的比较(未编辑,相同提示,相同种子)—— https://videorebirth.com/lp/hyperflow 我们测量了:相机控制 时间一致性 材质/细节渲染 整体平衡 速度:(相同片段:fl2va,124 帧,1344×768;仅生成时间,不包括启动和权重加载)在 4× H200 上约 60 秒 vs 49 步基础模型的约 175 秒(2.9 倍) 在 1× H200 上使用官方自动 CPU 卸载约 130 秒 vs 约 395 秒(3.0 倍) 结合 Sol-Attn、FlashAttention 和 VAE 并行,可以再加速超过 5 倍。在 8-GPU B200 集群上,它达到实时速度(生成时间少于片段本身的时间)。链接:代码:https://github.com/Video-Rebirth/hyperflow 权重:https://huggingface.co/videorebirth/hyperflow 演示比较:https://videorebirth.com/lp/hyperflow 此模型是 MiniMax-H3 的衍生品,根据 MiniMax H3 社区许可证协议发布。请在使用前仔细阅读许可证,特别是地域限制和可接受使用政策。已知限制:它是 H3 的少步蒸馏版:请在自己的提示(相同种子)上与基础模型比较 提示跟随性、语言、偏见和失败模式是基础模型的 不是通用 LoRA。它需要 HyperFlow 加载器,而不是标准 LoRA 加载器 开源版本支持 768p 推理分辨率 MiniMax H3 社区许可证排除美国、欧盟、英国和韩国(继承自基础模型的许可条款) 你最想在哪些用例上尝试这个?如果有人对自蒸馏方法好奇,我很乐意深入探讨技术细节。
相似文章
@AdinaYakup: HyperFlowNew MiniMax-H3 变体来自 @video_rebirth - 开放权重 8步 LoRA - 3倍速,无数据自蒸馏…
HyperFlow 推出了一个新的 MiniMax-H3 变体,该变体使用开放权重 LoRA,通过无数据自蒸馏实现 3 倍速推理,同时保持视频和立体声输出。
Dynamic-in-Few-Step: 统一动态计算与少步蒸馏的高效视频生成
本文提出了一种针对视频扩散模型的后训练加速框架,将动态结构稀疏化与少步蒸馏相结合,在保持生成质量的同时实现了显著加速。
AnyFlow:基于在策略流图蒸馏的任意步长视频扩散模型
AnyFlow 提出了一种新颖的任意步长视频扩散蒸馏框架,通过流图过渡学习和反向模拟优化完整的 ODE 采样轨迹,在匹配甚至超越基于一致性模型的同时,能够随采样步数预算进行扩展。
@HuggingPapers: NVIDIA 刚刚在 Hugging Face 上发布了 AnyFlow 首个任意步数视频扩散模型,可生成高质量文本...
NVIDIA 发布了 AnyFlow,这是首个用于文本到视频生成的任意步数视频扩散模型,允许在推理预算(4 到 50 步)之间实现平滑的质量缩放。
@DeRonin_: 这些人搭建了一个无限电影生成机器... @fal 的经过后训练的 Minimax H3 Max 比原版快50倍…
FastVideo 发布了一款开源的、经过后训练的 Minimax H3 模型,它能以50倍的速度生成视频,仅需3秒计算时间即可输出5秒的视频内容,适用于文本到音频视频的生成。