OpenVDN/vdn-minimax-h3

Hugging Face Models Trending 模型

摘要

VDN-Minimax-H3 是一款开源混合注意力模型,能够在几乎无损的质量下加速视频生成,具有快速推理和即插即用适配器的特性,由 MiniMax H3 提供支持。

任务: 文本到视频 标签: diffusers, safetensors, 文本到视频, 基础模型:MiniMaxAI/MiniMax-H3, 基础模型:微调:MiniMaxAI/MiniMax-H3, 许可证:其他, 地区:美国
查看原文
查看缓存全文

缓存时间: 2026/09/03 17:51

OpenVDN/vdn-minimax-h3 · Hugging Face

来源:https://huggingface.co/OpenVDN/vdn-minimax-h3

Video DeltaNet: 混合注意力机制实现接近无损质量的视频模型加速

代码库 | 模型权重 | 许可证

我们发布 VDN-Minimax-H3(简称 VDN-H3),这是一个基于 MiniMax H3 构建的混合注意力模型,其生成视频的速度快于播放速度。其主要特性包括:

  • 快速推理:在 8 张 B200 GPU 上,VDN-H3 可在 8 步去噪中于 11.23 秒内生成一段 14.4 秒的视频片段。
  • 混合架构:我们提出一种混合注意力架构:一个高效的逐帧线性注意力分支,以及一个保持骨干网络视觉质量与一致性的 Softmax 分支。
  • 即插即用:该检查点添加了一个独立的线性注意力分支和两个小型 LoRA 适配器,可在推理时合并到骨干网络中,无需修改骨干权重。
  • 完全开源:我们不仅开源权重,还同时发布了优化后的推理代码栈及相关训练代码。本仓库包含权重文件,推理与训练代码及安装说明请访问 OpenVDN/vdn-minimax-h3

下载权重

使用以下命令将全部文件(约 82 GB)下载至 ckpts/ 目录:

hf download OpenVDN/vdn-minimax-h3 --local-dir ckpts

目录结构如下:

ckpts/
  h3-base/                    # 发布的 MiniMax-H3:transformer、视频与音频 VAE、调度器 · 72 GB
  stage-b-step-2000/          # VDN-H3-50-step:linear_branch/ + adapters/default/ LoRA · 4.3 GB
  stage-dmd-step-250/         # VDN-H3-8-step:上述内容 + adapters/turbo/ · 5.1 GB

其中 stage-dmd-step-250 是标题数据所使用的 8 步模型,stage-b-step-2000 是其蒸馏自的 50 步模型。每个目录包含自述文件:model_spec.json 记录混合架构,metadata.json 记录训练配置,学习到的张量位于 linear_branch/model.safetensorsadapters/*/adapter_model.safetensors

首次渲染

环境配置完成后,最简单的启动方式是在单 GPU 上运行模型:

bash scripts/8nfe_tuned_fp8.sh

注意首次运行需编译所有内核,可能耗时数分钟;后续运行可复用缓存。
若要使用自定义提示词,应先通过 Qwen3-VL-32B 视觉语言模型编码,再传入主扩散模型:

python src/inference/encode_prompt.py --prompt "..." --out prompts/mine.pt
python src/inference/infer.py \
  --config configs/inference/8nfe_tuned_fp8.yaml \
  checkpoint=ckpts/stage-dmd-step-250 \
  render.prompt_file=prompts/mine.pt \
  render.out=results/mine.mp4

我们强烈建议在编码前先使用 H3-Context-IR 或官方 提示词写作技巧 重写提示词,这能显著提升生成视频的质量。

结果

以下为使用我们的推理流水线在 H200 与 B200 GPU 上,针对 768p、14.4 秒视频生成任务报告的稳态去噪速度:

H200:

配置GPU数每步时间50步 (VDN-H3-50-step)8步 (VDN-H3-8-step)
dense MiniMax-H3132.727.3 秒/步7.3 分钟4.4 分钟
VDN-H3 FP8111.29.4 秒/步9.4 分钟90.5 秒
VDN-H3 FP8 分布式82.291.9 秒/步1.9 分钟18.3 秒

B200:

配置GPU数每步时间50步 (VDN-H3-50-step)8步 (VDN-H3-8-step)
dense MiniMax-H3 (cuDNN)116.7413.95 秒/步13.95 分钟2.23 分钟
VDN-H3 FP816.415.3 秒/步15.3 分钟51 秒
VDN-H3 FP8 分布式81.401.2 秒/步1.2 分钟11.23 秒

上述数据不包含模型加载、预热、VAE 解码及 MP4 编码时间。在实际部署中,建议将提示词重写、VAE 解码与 MP4 转换放在独立机器上运行,使 8 张 GPU 专注于去噪任务。

致谢

VDN-H3 基于 MiniMax-H3 构建,使用其发布的 Transformer 权重。同时感谢 DiffusersFlashAttentionTriton,优化推理路径基于这些项目实现。

许可证

VDN-H3 是 MiniMax-H3 的衍生作品,依据 MiniMax H3 社区许可证协议 分发(本文件与上游仓库一致)。该协议仅在适用区域内授权使用,适用区域定义为全球范围,但不包括欧盟、英国、大韩民国及美国。协议声明在非授权区域使用需联系 MiniMax 获取许可,并包含再分发要求及可接受使用政策。其他要求包括:分发时必须包含本协议,修改文件需标注修改说明,非托管服务的第三方分发需包含代码仓库提供的 NOTICE 文件。
在使用或分发 VDN-H3 前,请务必阅读完整协议。本说明不替代许可证文本或法律建议。

相似文章

介绍 fal 推出的 H3 Max(5分钟阅读)

TLDR AI

H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

fal 发布 H3 Max

Product Hunt

Fal.ai 发布了 H3 Max,这是一款经过后训练的 MiniMax H3 变体,专门针对高质量视频生成进行了优化。据官方宣称,其在提示词遵循度、画面美学和生成速度方面均排名领先——生成 5 秒视频仅需约 3 秒,吞吐量达到官方 H3 模型的 35 倍。