unsloth/MiniMax-H3-GGUF

Hugging Face Models Trending 模型

摘要

Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,MiniMax-H3 是一个支持原生立体声音频的全模态视频生成系统,可通过 sd-cli 及其他平台进行本地执行。

任务:图像-文本到视频 标签:gguf, text-to-video, image-to-video, video-generation, stable-diffusion.cpp, unsloth, minimax, multimodal, image-text-to-video, en, zh, base_model:MiniMaxAI/MiniMax-H3, base_model:quantized:MiniMaxAI/MiniMax-H3, license:other, region:us
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:23

unsloth/MiniMax-H3-GGUF · Hugging Face

来源:https://huggingface.co/unsloth/MiniMax-H3-GGUF 说明见下文。适用于 MiniMax-H3 的 GGUF,兼容大多数平台,包括 stablediffusion.cpp 和 Unsloth。

Unsloth 中的 MiniMax-H3

在本地运行 MiniMax-H3

你可以通过 Unsloth 运行 MiniMax-H3:https://github.com/unslothai/unsloth/

MiniMaxAI/MiniMax-H3(https://huggingface.co/MiniMaxAI/MiniMax-H3)的 GGUF 量化版本。

MiniMax H3 是一个全模态生成系统,可生成带原生立体声音频的视频,最高 15 秒、24 FPS、32 kHz 立体声。运行时的两部分都在此仓库中:去噪器以及它们所需的 Qwen3-VL 文本编码器。

H3 附带两个去噪器,加载哪个决定了模型可以接受什么输入:

  • fl2va_pruned:H3-Base 的首帧和末帧变体。文本,外加零、一或两帧。
  • ref2va_pruned:参考变体。文本,外加参考图片、视频和音频。

它们是独立的检查点,不是设置,因此请选择与任务匹配的那个。两者在这里都以相同的量化级进行量化,因此特定量化档位的成本基本相同。

示例

UD-Q2_K_XL,这里最小的量化档位,960x544 分辨率,124 帧,24 FPS,8 步,引导系数 1.0,种子 11,在单张显卡上运行。

a red panda stepping along a mossy log in a misty forest, cinematic

GIF 已降采样且无声。如需包含原生 32 kHz 立体声音轨的完整 960x544 片段,请播放 assets/h3_gguf_ud_q2_k_xl.mp4(https://huggingface.co/unsloth/MiniMax-H3-GGUF/blob/main/assets/h3_gguf_ud_q2_k_xl.mp4)。H3 将音频与视频联合生成,因此音频是模型输出的一部分,而非事后添加。

文件

文本和帧,fl2va_pruned

文件大小
minimax_h3_fl2va_pruned-Q2_K.gguf6.26 GiB
minimax_h3_fl2va_pruned-UD-Q2_K_XL.gguf7.51 GiB
minimax_h3_fl2va_pruned-Q3_K.gguf8.16 GiB
minimax_h3_fl2va_pruned-UD-Q3_K_XL.gguf8.90 GiB
minimax_h3_fl2va_pruned-Q4_K.gguf10.64 GiB
minimax_h3_fl2va_pruned-Q5_0.gguf12.97 GiB
minimax_h3_fl2va_pruned-Q6_K.gguf15.45 GiB
minimax_h3_fl2va_pruned-Q8_0.gguf19.97 GiB

参考,ref2va_pruned

文件大小
minimax_h3_ref2va_pruned-Q2_K.gguf6.22 GiB
minimax_h3_ref2va_pruned-Q3_K.gguf8.12 GiB
minimax_h3_ref2va_pruned-Q4_K.gguf10.60 GiB
minimax_h3_ref2va_pruned-Q5_0.gguf12.94 GiB
minimax_h3_ref2va_pruned-Q6_K.gguf15.42 GiB
minimax_h3_ref2va_pruned-Q8_0.gguf19.94 GiB

文本编码器,两者共用:

文件大小
qwen3vl_32b_minimax_h3-Q2_K_M.gguf12.20 GiB
qwen3vl_32b_minimax_h3-Q4_K_M.gguf16.97 GiB

UD- 前缀的量化档位是动态混合精度构建。统一档位则全程使用一种类型。将 Q2_K_M 文本编码器与两个最小的去噪器搭配,其他情况下使用 Q4_K_M 文本编码器。文本编码器和 VAE 是共享的,因此在两个去噪器之间切换只需下载一个去噪器,无需其他操作。VAE 未在这里重复提供,请从 Comfy-Org/MiniMax-H3(https://huggingface

相似文章

Unsloth MiniMax M3 GGUF

Reddit r/LocalLLaMA

Unsloth 正在将 MiniMax M3 模型的 GGUF 量化版本上传到 Hugging Face。

unsloth/MiniMax-M3-GGUF

Hugging Face Models Trending

Unsloth 发布了 MiniMax-M3 多模态模型的 GGUF 量化版本,支持图像-文本到文本任务,兼容 Transformers、llama.cpp、vLLM 等推理引擎。

unsloth/Qwen3.6-27B-GGUF

Hugging Face Models Trending

Unsloth 发布了 Qwen3.6-27B 模型的 GGUF 量化版本,具备更强的智能体编程能力、工具调用功能,并支持 Unsloth Studio。

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

realrebelai/MiniMax-H3_GGUFs

Hugging Face Models Trending

提供 MiniMax-H3 模型的 GGUF 量化版本的 Hugging Face 仓库,用于 ComfyUI,包含目录结构和所需 VAE 的链接。