Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
摘要
该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。
查看缓存全文
缓存时间: 2026/08/06 19:43
Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot · Hugging Face
MiniMax H3 - 量化与剪枝合集(INT4 / INT8 / NVFP4)
本仓库是一个社区整理的MiniMax H3(Hailuo 3.0)(https://huggingface.co/MiniMaxAI/MiniMax-H3) 量化与剪枝权重合集,专为 ComfyUI 等本地推理环境优化。
通过将各种量化格式(INT4、INT8、混合精度和 NVFP4)统一整合到单一结构化仓库中,本中心让使用消费级 GPU(16GB - 24GB 显存)的用户能够更轻松地体验 MiniMax H3 强大的全模态文本/图像/音频到视频生成能力。
💻 硬件与 GPU 选择指南(该下载哪个文件?)
如果你是本地生成的新手,不确定该下载什么,请根据你的显卡参考以下指南。
⚠️**关于 VAE 的说明:**无论你使用什么 GPU,每个人都必须下载
/vae文件夹中的两个文件(minimax_h3_audio_vae_fp32.safetensors和minimax_h3_video_vae_fp16.safetensors)。
1. 标准高端 GPU(16GB 显存)
适用于 RTX 4070 Ti Super、RTX 4080 等。
- 扩散模型:下载INT4(
MiniMax_H3_[...]_pruned_int4_convrot.safetensors)或MIXED(_mixed_int4_int8_)版本。 - **文本编码器:**下载
qwen3vl_32b_minimax_h3_int4_convrot.safetensors
2. 发烧级 GPU(24GB 显存)
适用于 RTX 3090、RTX 4090 等。
- 扩散模型:下载INT8(
MiniMax_H3_[...]_pruned_int8_convrot.safetensors)以获得最佳剪枝质量。 - **文本编码器:**下载
qwen3vl_32b_minimax_h3_int8_convrot.safetensors
3. 仅限 Nvidia Blackwell GPU
仅适用于 RTX 5090、PRO 6000 及其他下一代 Blackwell 显卡。请勿为 30/40 系列显卡下载这些文件!
- 扩散模型:下载NVFP4(
MiniMax_H3_[...]_pruned_nvfp4.safetensors)。 - **文本编码器:**下载
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
FL2VA 与 Ref2VA(有什么区别?)
- **FL2VA:**如果你只想进行标准的文本到视频或简单的图像到视频(使用一张或两张起始/结束图像),请下载此版本。
- **Ref2VA:**如果你想使用高级全模态参考(多张图像、视频片段或音频输入),请下载此版本。
📦 包含的文件与格式
本仓库采用统一的命名规范(MiniMax_H3_FL2VA_*和MiniMax_H3_Ref2VA_*),便于集成到你的本地流水线中。
1. 扩散模型
- **MIXED INT4/INT8:**混合精度模型。需要 15GB+ 显存(约 15.5 GB)。
MiniMax_H3_FL2VA_pruned_mixed_int4_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_mixed_int4_int8_convrot.safetensors
- **INT8:**最高质量的剪枝模型。需要 24GB+ 显存(约 21 GB)。
MiniMax_H3_FL2VA_pruned_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int8_convrot.safetensors
- **INT4:**面向标准消费级硬件的高压缩模型(约 11.3 GB)。
MiniMax_H3_FL2VA_pruned_int4_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int4_convrot.safetensors
- **NVFP4:**实验性 Nvidia 4 位浮点模型(需要 Blackwell 架构)。
MiniMax_H3_Ref2VA_pruned_nvfp4.safetensors(12.5 GB)MiniMax_H3_Ref2VA_nvfp4_mixed.safetensors(24.4 GB)MiniMax_H3_FL2VA_pruned_nvfp4.safetensors(12.5 GB)
2. 文本编码器(/text_encoders)
qwen3vl_32b_minimax_h3_int4_convrot.safetensors(15.0 GB) - 推荐用于 16GB GPUqwen3vl_32b_minimax_h3_int8_convrot.safetensors(27.1 GB) - 推荐用于 24GB GPUqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(15.7 GB) - 适用于 Blackwell GPU
3. VAE(/vae)
minimax_h3_audio_vae_fp32.safetensors(605 MB - 音频解码器)minimax_h3_video_vae_fp16.safetensors(5.21 GB - 视频解码器)
原始 MiniMax H3 系统概述
MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能以原生的立体声音频生成分辨率高达 2K、时长最长 15 秒的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解和生成能力,能够在遵循复杂多模态指令方面表现出色。
H3 支持以下输入和输出规格:
| 类别 | 规格 |
|---|---|
| 输出时长 | 4–15 秒 |
| 输出宽高比 | 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16 |
| 输出分辨率 | 支持多种分辨率尺寸。默认将较短边设置为 768 像素。可通过 H3-Regenerate-2K 实现 2K 生成 |
| 输出帧率 | 24 FPS |
| 输出音频 | 32 kHz 立体声 |
| 支持的对话语言 | 稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语 |
模型变体与输入规格
| 模型变体 | 输入模式 | 规格 |
|---|---|---|
| H3-Base-FL2VA | 首尾帧模式 | 支持零张、一张或两张输入图像。 - 无图像输入:文本到视频模式 - 单张图像输入:首帧到视频或尾帧到视频生成 - 两张图像输入:首尾帧到视频生成 |
| H3-Base-Ref2VA | 全模态参考模式 | 支持多模态参考输入: - 图像:≤ 9 张图像 - 视频:≤ 3 个片段;每个片段时长须为 2–15 秒;总时长 ≤ 15 秒 - 音频:≤ 3 个片段;音频必须伴随图像或视频输入,不能作为唯一输入;每个片段时长须为 2–15 秒;总时长 ≤ 15 秒 - **混合输入:**所有输入类型的文件总数上限为 12 个 |
模型架构
H3-Context-IR
H3-Context-IR 是一个托管的预处理与编排系统,专为自由形式的多模态输入设计。它解释文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。H3-Context-IR 将其对上下文的理解决序化为一种 H3-Base 可接受的结构化表示。
H3-Base
- H3-Base 使用相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成统一的打包多模态序列。
- 具体而言,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频仅由 H3-AudioVAE 编码。
- H3-Omni-Transformer 联合预测视频和音频潜变量,然后分别解码为视频和立体声音频。
H3-Encoder
- H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的隐藏状态提供给 H3-Omni-Transformer。
H3-VAE
- H3-VisualVAE 是一个时间因果视频自编码器,空间压缩倍率为 16×,时间压缩倍率为 4×,具有 24 个潜变量通道(f16t4d24)。
- H3-AudioVAE 对左右声道使用相同的编码器和解码器,同时独立处理每个声道。它将 32 kHz 音频压缩为时间速率为 40 Hz 的潜变量 token 序列。
H3-Omni-Transformer
- H3-Omni-Transformer 是一个 33B 参数的密集单流 Transformer。
- 该模型使用三维多模态旋转位置嵌入(MM-RoPE)来表示时间维度和两个空间维度
(t, h, w)上的位置关系。
许可证与法律声明
MiniMax H3(及其量化衍生版本)根据MiniMax H3 社区许可协议 (https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/LICENSE) 发布。
使用官方 API 时,用户提交的文本、图像和视频以及增强提示词均须经过自动审核。疑似非法、色情或侵犯第三方权利的内容可能会被屏蔽。这些护栏不影响被许可方在 MiniMax H3 社区许可协议下的义务,尤其是与合法使用和使用限制相关的义务。
原始创作者 / 联系方式
- 全球 API:platform.minimax.io (https://platform.minimax.io/)
- 联系邮箱:[email protected]
相似文章
sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。
realrebelai/MiniMax-H3_GGUFs
提供 MiniMax-H3 模型的 GGUF 量化版本的 Hugging Face 仓库,用于 ComfyUI,包含目录结构和所需 VAE 的链接。
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、原生音频与 2K 视频
MiniMax H3 是新一代开放权重视频模型,能够根据文本、图像、视频或音频生成带有原生立体声的 2K 视频,并在发布当天就获得了 ComfyUI 支持及优化,使其能够在消费级 GPU 上运行。
ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。