unsloth/MiniMax-H3-GGUF
摘要
Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,MiniMax-H3 是一个支持原生立体声音频的全模态视频生成系统,可通过 sd-cli 及其他平台进行本地执行。
查看缓存全文
缓存时间: 2026/08/12 08:23
unsloth/MiniMax-H3-GGUF · Hugging Face
来源:https://huggingface.co/unsloth/MiniMax-H3-GGUF 说明见下文。适用于 MiniMax-H3 的 GGUF,兼容大多数平台,包括 stablediffusion.cpp 和 Unsloth。
Unsloth 中的 MiniMax-H3
在本地运行 MiniMax-H3
你可以通过 Unsloth 运行 MiniMax-H3:https://github.com/unslothai/unsloth/
MiniMaxAI/MiniMax-H3(https://huggingface.co/MiniMaxAI/MiniMax-H3)的 GGUF 量化版本。
MiniMax H3 是一个全模态生成系统,可生成带原生立体声音频的视频,最高 15 秒、24 FPS、32 kHz 立体声。运行时的两部分都在此仓库中:去噪器以及它们所需的 Qwen3-VL 文本编码器。
H3 附带两个去噪器,加载哪个决定了模型可以接受什么输入:
fl2va_pruned:H3-Base 的首帧和末帧变体。文本,外加零、一或两帧。ref2va_pruned:参考变体。文本,外加参考图片、视频和音频。
它们是独立的检查点,不是设置,因此请选择与任务匹配的那个。两者在这里都以相同的量化级进行量化,因此特定量化档位的成本基本相同。
示例
UD-Q2_K_XL,这里最小的量化档位,960x544 分辨率,124 帧,24 FPS,8 步,引导系数 1.0,种子 11,在单张显卡上运行。
a red panda stepping along a mossy log in a misty forest, cinematic
GIF 已降采样且无声。如需包含原生 32 kHz 立体声音轨的完整 960x544 片段,请播放 assets/h3_gguf_ud_q2_k_xl.mp4(https://huggingface.co/unsloth/MiniMax-H3-GGUF/blob/main/assets/h3_gguf_ud_q2_k_xl.mp4)。H3 将音频与视频联合生成,因此音频是模型输出的一部分,而非事后添加。
文件
文本和帧,fl2va_pruned:
| 文件 | 大小 |
|---|---|
minimax_h3_fl2va_pruned-Q2_K.gguf | 6.26 GiB |
minimax_h3_fl2va_pruned-UD-Q2_K_XL.gguf | 7.51 GiB |
minimax_h3_fl2va_pruned-Q3_K.gguf | 8.16 GiB |
minimax_h3_fl2va_pruned-UD-Q3_K_XL.gguf | 8.90 GiB |
minimax_h3_fl2va_pruned-Q4_K.gguf | 10.64 GiB |
minimax_h3_fl2va_pruned-Q5_0.gguf | 12.97 GiB |
minimax_h3_fl2va_pruned-Q6_K.gguf | 15.45 GiB |
minimax_h3_fl2va_pruned-Q8_0.gguf | 19.97 GiB |
参考,ref2va_pruned:
| 文件 | 大小 |
|---|---|
minimax_h3_ref2va_pruned-Q2_K.gguf | 6.22 GiB |
minimax_h3_ref2va_pruned-Q3_K.gguf | 8.12 GiB |
minimax_h3_ref2va_pruned-Q4_K.gguf | 10.60 GiB |
minimax_h3_ref2va_pruned-Q5_0.gguf | 12.94 GiB |
minimax_h3_ref2va_pruned-Q6_K.gguf | 15.42 GiB |
minimax_h3_ref2va_pruned-Q8_0.gguf | 19.94 GiB |
文本编码器,两者共用:
| 文件 | 大小 |
|---|---|
qwen3vl_32b_minimax_h3-Q2_K_M.gguf | 12.20 GiB |
qwen3vl_32b_minimax_h3-Q4_K_M.gguf | 16.97 GiB |
UD- 前缀的量化档位是动态混合精度构建。统一档位则全程使用一种类型。将 Q2_K_M 文本编码器与两个最小的去噪器搭配,其他情况下使用 Q4_K_M 文本编码器。文本编码器和 VAE 是共享的,因此在两个去噪器之间切换只需下载一个去噪器,无需其他操作。VAE 未在这里重复提供,请从 Comfy-Org/MiniMax-H3(https://huggingface
相似文章
Unsloth MiniMax M3 GGUF
Unsloth 正在将 MiniMax M3 模型的 GGUF 量化版本上传到 Hugging Face。
unsloth/MiniMax-M3-GGUF
Unsloth 发布了 MiniMax-M3 多模态模型的 GGUF 量化版本,支持图像-文本到文本任务,兼容 Transformers、llama.cpp、vLLM 等推理引擎。
unsloth/Qwen3.6-27B-GGUF
Unsloth 发布了 Qwen3.6-27B 模型的 GGUF 量化版本,具备更强的智能体编程能力、工具调用功能,并支持 Unsloth Studio。
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
realrebelai/MiniMax-H3_GGUFs
提供 MiniMax-H3 模型的 GGUF 量化版本的 Hugging Face 仓库,用于 ComfyUI,包含目录结构和所需 VAE 的链接。