sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
摘要
发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。
查看缓存全文
缓存时间: 2026/08/06 19:43
sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4 · Hugging Face
Qwen3-VL-32B Heretic(MiniMax-H3 文本编码器)— NVFP4
无审查版的 MiniMax-H3 文本编码器,大小 15.7 GB——单张 16 GB 显卡即可运行。
这是对 ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 的混合精度 NVFP4 重新量化,后者是用于 MiniMax-H3 视频生成的 Heretic(无审查)文本编码器。
| 构建 | 大小 | 可装入 16 GB 显卡? |
|---|---|---|
| Heretic INT8-ConvRot(上游) | 26.4 GB | 否(需要卸载/offload) |
| Heretic NVFP4(本仓库) | 15.7 GB | 是 |
| Comfy-Org NVFP4(审查版) | 15.7 GB | 是 |
与 Comfy-Org 官方 NVFP4 编码器大小相同,因此可以直接替换:只需让 CLIPLoader 指向这个文件,MiniMax-H3 工作流的其余部分保持不变。
为什么
拥有 80 GB 显卡的人,一直都有选择。这个版本是为没有这种卡的人准备的。创作工作不应依赖数据中心级别的硬件——这正是量化它的意义所在。
实测
使用 MiniMax-H3 fl2va 剪枝 INT8 扩散模型,res_multistep 20 步,ComfyUI 0.30.0,Sage Attention,在以下设备上生成了 6 秒 480×864 竖屏视频(含音频):
| 项目 | 数值 |
|---|---|
| GPU | 1× RTX PRO 2000 Blackwell(16 GB,sm_120) |
| 生成期间峰值显存 | **约 9. |
相似文章
ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。
Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。
@aisearchio: Minimax H3 GGUFs 来了!Q2 仅有 8.49 GB,因此你可以在较低端的 GPU 上运行它。 https://huggingface.co/realrebela…
宣布 MiniMax H3 的 GGUF 量化版本现已可用,其中 Q2 版本仅有 8.49 GB,适合较低端的 GPU。
ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot
一个Hugging Face仓库,提供未经审查的Qwen3-VL-32B变体的ComfyUI safetensors检查点,包含BF16和INT8 ConvRot H3条件编码器以及可选的生成尾部。
nvidia/Qwen3.6-27B-NVFP4
NVIDIA发布了Qwen3.6-27B-NVFP4,这是阿里巴巴Qwen3.6-27B模型的量化版本,针对在NVIDIA GPU上的部署进行了优化,支持文本、图像和视频输入。