ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
摘要
该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。
查看缓存全文
缓存时间: 2026/08/04 01:32
ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot · Hugging Face
来源:https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#qwen3-vl-32b-ultra-uncensored-heretic–minimax-h3-comfyui-int8-convrotQwen3-VL-32B Ultra Uncensored Heretic — MiniMax-H3 ComfyUI INT8 ConvRot
此仓库包含两个基于llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic(https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic)构建的 ComfyUI safetensors 文件。
- 一个普通的 MiniMax-H3 文本/视觉条件编码器,包含语言层 0–49;
- 以及一个可选的仅用于生成的后缀部分,包含层 50–63、最终归一化层和 LM 头,用于提示词增强。
MiniMax-H3 消费语言层 49 之后的未归一化隐藏状态。因此,本检查点包含 Qwen3-VL 嵌入、语言层 0–49 以及完整的视觉塔。它有意省略了语言层 50–63、最终语言归一化层和 LM 头。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#minimax-h3-conditioning-encoderMiniMax-H3 条件编码器
qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors
- 大小:26,363,476,151 字节(24.55 GiB)
- SHA-256:
d84547412144b7c50a6ec77437a889b869d3ace88da77ef1775d3d2a4901c192 - 1,604 个张量
- 350 个学习得到的行级 INT8 ConvRot 语言矩阵
- 每个学习到的语言矩阵的 ConvRot 组大小为 256
- 一个简单的张量级 INT8 词元嵌入
- 551 个以 BF16 保留的张量,包括完整的视觉塔和所有归一化层
- 351 个 FP32 权重缩放因子和 351 个 ComfyUI 量化描述符
上游完整的 BF16 源仍可在源仓库(https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic)中获取。这里不重复提供。BF16 版本的 MiniMax-H3 包超过 51 GB,对于 32 GB 的 RTX 5090 来说不实用;此 INT8 版本是推荐版本。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#optional-prompt-enhancement-tail可选的提示词增强后缀部分
qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors
- 大小:7,609,128,707 字节(7.09 GiB)
- SHA-256:
b5bb9bb8dc87cf11cbee241a2d95d6d42fe52cf695ed26c093ac321f31160b20 - 354 个张量
- 语言层 50–63、最终语言归一化层和 LM 头
- 98 个学习得到的行级 INT8 ConvRot 矩阵
- 一个简单的行级 INT8 ConvRot LM 头,由节点分块计算
- ConvRot 组大小为 256
- 57 个张量以 BF16 精确保留
该后缀部分不是独立的 CLIP,也不重复词元嵌入或视觉塔。它由ComfyUI-MiniMax-H3-Guide(https://github.com/ethanfel/ComfyUI-MiniMax-H3-Guide)节点临时加载,并复用所连接的标准 MiniMax-H3 CLIP 中的 0–49 层。生成结束后,它会被卸载,原始的条件 CLIP 保持不变。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#comfyui-installationComfyUI 安装
将两个 safetensors 文件放入:
ComfyUI/models/text_encoders/MiniMax-H3/
在CLIPLoader中选择类型minimax(MiniMax-H3)。请使用当前的 ComfyUI 版本及其固定的comfy-kitchen依赖。
提示词增强的使用方法:
- 使用 ComfyUI 标准的
CLIPLoader(类型minimax)加载 0–49 层条件检查点。 - 将该 CLIP 连接到MiniMax H3 Prompt Enhancer(可选 CLIP 后缀)。
- 在节点的
clip_tail下拉菜单中选择 50–63 层后缀部分。 - 将
enhanced_prompt和返回的、未改变的clip发送到普通的 MiniMax-H3 guide 节点。
如果所连接的 CLIP 已经是一个完整的生成模型,请将clip_tail保持为[none — connected CLIP is already complete]。此时增强器将调用所连接 CLIP 的普通generate()路径,而不会加载或需要此后缀部分。
这些是 ComfyUI 检查点,而不是完整的 Transformers 生成仓库。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#runtime-verification运行时验证
条件检查点和增强器已通过实际运行时测试:
- ComfyUI 提交:
14b05228cef127ce529bc0c08660770d4af3e9a8 comfy-kitchen==0.2.26comfy-aimdo==0.4.11- PyTorch
2.8.0+cu128 - NVIDIA GeForce RTX 5090,32 GB 显存
- 检测到的模型类:
MiniMaxH3TEModel_ - 有限条件输出:
(1, 12, 5120) - 正确的
minimax_token_tags:(12,) - 编码后显存:约分配 24.7 GiB / 保留 26.1 GiB
- 标准
CLIPLoader加载条件模型时恰好有 50 个语言层,且没有最终归一化层或 LM 头。 - 可选后缀路径通过所有 64 层生成一个词元,返回完全相同的 CLIP 对象,然后使其保持在恰好 50 层且无归一化头/ LM 头的状态。
- 后缀部分卸载后,返回的 CLIP 成功编码了 MiniMax 条件:有限输出
(1, 4, 5120)且带有词元标签。 - 无后缀路径使用完整的 Qwen3-VL-4B ComfyUI CLIP 进行了测试,并在未加载 MiniMax 后缀的情况下成功生成。
所使用的本地 CUDA 12.8 PyTorch 构建使用了回退操作,因为此comfy-kitchen版本推荐 CUDA 13.0+ 以使用其优化内核。尽管如此,编码仍然成功完成。建议使用当前 ComfyUI 环境及其推荐的 PyTorch 构建。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#provenance来源
固定的上游源:
repository: llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic revision: c44b949b30d111666a5ed9851c5cd633ed39b070
两个上游 BF16 分片均在该修订版本下载,并在打包前根据其 Hugging Face LFS SHA-256 值进行了验证。
源模型卡报告了针对语言层 31–40 中attn.o_proj的 Heretic v1.2.0 ARA 编辑。所有这些被编辑的层都位于 MiniMax-H3 保留的 0–49 范围内,因此本检查点中包含这些未经审查的编辑。源报告显示拒绝率为 4/100,而原始模型为 99/100,KL 散度为 0.0421,PIQA 为 92.87%,MMLU 为 79.87%。
Abliteration 能减少拒答行为,但不保证会移除所有拒答或安全行为,并且可能影响模型质量。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#conversion转换
MiniMax-H3 BF16 包使用silveroxides/convert_to_quant(https://github.com/silveroxides/convert_to_quant)1.3.1 版本转换。成功构建使用了 AdamW AdaRound 优化和平台期早停,而不是简单舍入:
env PYTHONPATH=.deps python .deps/bin/ctq \ -i qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_bf16.safetensors \ -o qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --custom-layers '^model\.embed_tokens\.weight$' \ --custom-type int8 \ --custom-scaling-mode tensor \ --custom-simple \ --exclude-layers '^visual\.' \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL
语言块矩阵使用学习得到的 ConvRot。只有词元嵌入使用简单的张量级 INT8,因为 ComfyUI 嵌入查找需要该布局。视觉塔以 BF16 精确保留。
生成后缀部分是从同一固定源打包并单独转换的:
env PYTHONPATH=.deps .deps/bin/ctq \ -i qwen3vl_32b_minimax_h3_generation_tail_50_63_bf16.safetensors \ -o qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL \ --layer-config tools/qwen3vl32b_generation_tail_quant.json \ --fullmatch
98 个 transformer 矩阵使用学习得到的 AdamW ConvRot。LM 头使用简单的行级 ConvRot,以便增强器能够以小分块计算其 151,936 个输出行,避免多 GB 的临时反量化峰值。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#validation验证
完成的文件通过了每个张量、数据类型、形状、缩放因子、逐层描述符和全局量化元数据条目的结构验证。所有 551 个受保护的 BF16 张量与打包的 BF16 源进行了逐字节比较,并且没有变化。
后缀部分也通过了精确的结构验证:保留的 57 个 BF16 张量(304,128 字节)与源逐字节相同;其 99 个 INT8 权重、缩放因子、描述符和全局量化元数据均与声明的布局一致。将基础源拓扑(902 个张量)与后缀源拓扑(156 个张量)组合后,可重建完整模型的所有 1,058 个张量,且没有键冲突。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#credits致谢
- 未经审查的源和评估:
llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic(https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic) - 原始模型:
Qwen/Qwen3-VL-32B-Instruct(https://huggingface.co/Qwen/Qwen3-VL-32B-Instruct) - 量化工具:
silveroxides/convert_to_quant(https://github.com/silveroxides/convert_to_quant)
相似文章
ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot
一个Hugging Face仓库,提供未经审查的Qwen3-VL-32B变体的ComfyUI safetensors检查点,包含BF16和INT8 ConvRot H3条件编码器以及可选的生成尾部。
sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。
Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。
Kijai/MiniMax-H3_comfy
一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。
drbaph/MiniMax-H3-Turbo-Lora-ComfyUI
MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。