OpenVDN/vdn-minimax-h3
摘要
VDN-Minimax-H3 是一款开源混合注意力模型,能够在几乎无损的质量下加速视频生成,具有快速推理和即插即用适配器的特性,由 MiniMax H3 提供支持。
查看缓存全文
缓存时间: 2026/09/03 17:51
OpenVDN/vdn-minimax-h3 · Hugging Face
来源:https://huggingface.co/OpenVDN/vdn-minimax-h3
Video DeltaNet: 混合注意力机制实现接近无损质量的视频模型加速
我们发布 VDN-Minimax-H3(简称 VDN-H3),这是一个基于 MiniMax H3 构建的混合注意力模型,其生成视频的速度快于播放速度。其主要特性包括:
- 快速推理:在 8 张 B200 GPU 上,VDN-H3 可在 8 步去噪中于 11.23 秒内生成一段 14.4 秒的视频片段。
- 混合架构:我们提出一种混合注意力架构:一个高效的逐帧线性注意力分支,以及一个保持骨干网络视觉质量与一致性的 Softmax 分支。
- 即插即用:该检查点添加了一个独立的线性注意力分支和两个小型 LoRA 适配器,可在推理时合并到骨干网络中,无需修改骨干权重。
- 完全开源:我们不仅开源权重,还同时发布了优化后的推理代码栈及相关训练代码。本仓库包含权重文件,推理与训练代码及安装说明请访问 OpenVDN/vdn-minimax-h3。
下载权重
使用以下命令将全部文件(约 82 GB)下载至 ckpts/ 目录:
hf download OpenVDN/vdn-minimax-h3 --local-dir ckpts
目录结构如下:
ckpts/
h3-base/ # 发布的 MiniMax-H3:transformer、视频与音频 VAE、调度器 · 72 GB
stage-b-step-2000/ # VDN-H3-50-step:linear_branch/ + adapters/default/ LoRA · 4.3 GB
stage-dmd-step-250/ # VDN-H3-8-step:上述内容 + adapters/turbo/ · 5.1 GB
其中 stage-dmd-step-250 是标题数据所使用的 8 步模型,stage-b-step-2000 是其蒸馏自的 50 步模型。每个目录包含自述文件:model_spec.json 记录混合架构,metadata.json 记录训练配置,学习到的张量位于 linear_branch/model.safetensors 和 adapters/*/adapter_model.safetensors。
首次渲染
环境配置完成后,最简单的启动方式是在单 GPU 上运行模型:
bash scripts/8nfe_tuned_fp8.sh
注意首次运行需编译所有内核,可能耗时数分钟;后续运行可复用缓存。
若要使用自定义提示词,应先通过 Qwen3-VL-32B 视觉语言模型编码,再传入主扩散模型:
python src/inference/encode_prompt.py --prompt "..." --out prompts/mine.pt
python src/inference/infer.py \
--config configs/inference/8nfe_tuned_fp8.yaml \
checkpoint=ckpts/stage-dmd-step-250 \
render.prompt_file=prompts/mine.pt \
render.out=results/mine.mp4
我们强烈建议在编码前先使用 H3-Context-IR 或官方 提示词写作技巧 重写提示词,这能显著提升生成视频的质量。
结果
以下为使用我们的推理流水线在 H200 与 B200 GPU 上,针对 768p、14.4 秒视频生成任务报告的稳态去噪速度:
H200:
| 配置 | GPU数 | 每步时间 | 50步 (VDN-H3-50-step) | 8步 (VDN-H3-8-step) |
|---|---|---|---|---|
| dense MiniMax-H3 | 13 | 2.727.3 秒/步 | 7.3 分钟 | 4.4 分钟 |
| VDN-H3 FP8 | 1 | 11.29.4 秒/步 | 9.4 分钟 | 90.5 秒 |
| VDN-H3 FP8 分布式 | 8 | 2.291.9 秒/步 | 1.9 分钟 | 18.3 秒 |
B200:
| 配置 | GPU数 | 每步时间 | 50步 (VDN-H3-50-step) | 8步 (VDN-H3-8-step) |
|---|---|---|---|---|
| dense MiniMax-H3 (cuDNN) | 11 | 6.7413.95 秒/步 | 13.95 分钟 | 2.23 分钟 |
| VDN-H3 FP8 | 1 | 6.415.3 秒/步 | 15.3 分钟 | 51 秒 |
| VDN-H3 FP8 分布式 | 8 | 1.401.2 秒/步 | 1.2 分钟 | 11.23 秒 |
上述数据不包含模型加载、预热、VAE 解码及 MP4 编码时间。在实际部署中,建议将提示词重写、VAE 解码与 MP4 转换放在独立机器上运行,使 8 张 GPU 专注于去噪任务。
致谢
VDN-H3 基于 MiniMax-H3 构建,使用其发布的 Transformer 权重。同时感谢 Diffusers、FlashAttention 和 Triton,优化推理路径基于这些项目实现。
许可证
VDN-H3 是 MiniMax-H3 的衍生作品,依据 MiniMax H3 社区许可证协议 分发(本文件与上游仓库一致)。该协议仅在适用区域内授权使用,适用区域定义为全球范围,但不包括欧盟、英国、大韩民国及美国。协议声明在非授权区域使用需联系 MiniMax 获取许可,并包含再分发要求及可接受使用政策。其他要求包括:分发时必须包含本协议,修改文件需标注修改说明,非托管服务的第三方分发需包含代码仓库提供的 NOTICE 文件。
在使用或分发 VDN-H3 前,请务必阅读完整协议。本说明不替代许可证文本或法律建议。
相似文章
@radixark: SGLang-Diffusion 支持快速、可扩展的多模态生成推理。最新的 VDN-H3 工作使 @MiniMa…
SGLang-Diffusion 与 MiniMax 的 VDN-H3 支持快速、可扩展的视频生成,在 8× B200 GPU 上,仅需 9.0 秒即可生成 14.4 秒的 768p 视频,实现比实时更快的推理。
介绍 fal 推出的 H3 Max(5分钟阅读)
H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
MiniMax H3 Max(由 fal 在 MiniMax H3 上后训练)树立了视频生成的新 Pareto Frontier,速度比基础模型快近50倍。
MiniMax H3 Max 由 fal 在 MiniMax H3 上进行后训练,为视频生成树立了新的 Pareto Frontier,生成时间比基础模型快近50倍,在 image-to-video 和 text-to-video 任务中分别实现了18倍和24倍的速度提升。
fal 发布 H3 Max
Fal.ai 发布了 H3 Max,这是一款经过后训练的 MiniMax H3 变体,专门针对高质量视频生成进行了优化。据官方宣称,其在提示词遵循度、画面美学和生成速度方面均排名领先——生成 5 秒视频仅需约 3 秒,吞吐量达到官方 H3 模型的 35 倍。