ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot

Hugging Face Models Trending 模型

摘要

该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。

任务:图像-文本到文本 标签:comfyui, minimax-h3, qwen3-vl, qwen3-vl-32b, heretic, abliterated, uncensored, int8, convrot, quantized, image-text-to-text, en, base_model:llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic, base_model:finetune:llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/08/04 01:32

ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot · Hugging Face

来源:https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#qwen3-vl-32b-ultra-uncensored-heretic–minimax-h3-comfyui-int8-convrotQwen3-VL-32B Ultra Uncensored Heretic — MiniMax-H3 ComfyUI INT8 ConvRot

此仓库包含两个基于llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic(https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic)构建的 ComfyUI safetensors 文件。

  • 一个普通的 MiniMax-H3 文本/视觉条件编码器,包含语言层 0–49;
  • 以及一个可选的仅用于生成的后缀部分,包含层 50–63、最终归一化层和 LM 头,用于提示词增强。

MiniMax-H3 消费语言层 49 之后的未归一化隐藏状态。因此,本检查点包含 Qwen3-VL 嵌入、语言层 0–49 以及完整的视觉塔。它有意省略了语言层 50–63、最终语言归一化层和 LM 头。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#minimax-h3-conditioning-encoderMiniMax-H3 条件编码器

qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors

  • 大小:26,363,476,151 字节(24.55 GiB)
  • SHA-256:d84547412144b7c50a6ec77437a889b869d3ace88da77ef1775d3d2a4901c192
  • 1,604 个张量
  • 350 个学习得到的行级 INT8 ConvRot 语言矩阵
  • 每个学习到的语言矩阵的 ConvRot 组大小为 256
  • 一个简单的张量级 INT8 词元嵌入
  • 551 个以 BF16 保留的张量,包括完整的视觉塔和所有归一化层
  • 351 个 FP32 权重缩放因子和 351 个 ComfyUI 量化描述符

上游完整的 BF16 源仍可在源仓库(https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic)中获取。这里不重复提供。BF16 版本的 MiniMax-H3 包超过 51 GB,对于 32 GB 的 RTX 5090 来说不实用;此 INT8 版本是推荐版本。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#optional-prompt-enhancement-tail可选的提示词增强后缀部分

qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors

  • 大小:7,609,128,707 字节(7.09 GiB)
  • SHA-256:b5bb9bb8dc87cf11cbee241a2d95d6d42fe52cf695ed26c093ac321f31160b20
  • 354 个张量
  • 语言层 50–63、最终语言归一化层和 LM 头
  • 98 个学习得到的行级 INT8 ConvRot 矩阵
  • 一个简单的行级 INT8 ConvRot LM 头,由节点分块计算
  • ConvRot 组大小为 256
  • 57 个张量以 BF16 精确保留

该后缀部分不是独立的 CLIP,也不重复词元嵌入或视觉塔。它由ComfyUI-MiniMax-H3-Guide(https://github.com/ethanfel/ComfyUI-MiniMax-H3-Guide)节点临时加载,并复用所连接的标准 MiniMax-H3 CLIP 中的 0–49 层。生成结束后,它会被卸载,原始的条件 CLIP 保持不变。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#comfyui-installationComfyUI 安装

将两个 safetensors 文件放入:

ComfyUI/models/text_encoders/MiniMax-H3/

CLIPLoader中选择类型minimax(MiniMax-H3)。请使用当前的 ComfyUI 版本及其固定的comfy-kitchen依赖。

提示词增强的使用方法:

  1. 使用 ComfyUI 标准的CLIPLoader(类型minimax)加载 0–49 层条件检查点。
  2. 将该 CLIP 连接到MiniMax H3 Prompt Enhancer(可选 CLIP 后缀)
  3. 在节点的clip_tail下拉菜单中选择 50–63 层后缀部分。
  4. enhanced_prompt和返回的、未改变的clip发送到普通的 MiniMax-H3 guide 节点。

如果所连接的 CLIP 已经是一个完整的生成模型,请将clip_tail保持为[none — connected CLIP is already complete]。此时增强器将调用所连接 CLIP 的普通generate()路径,而不会加载或需要此后缀部分。

这些是 ComfyUI 检查点,而不是完整的 Transformers 生成仓库。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#runtime-verification运行时验证

条件检查点和增强器已通过实际运行时测试:

  • ComfyUI 提交:14b05228cef127ce529bc0c08660770d4af3e9a8
  • comfy-kitchen==0.2.26
  • comfy-aimdo==0.4.11
  • PyTorch 2.8.0+cu128
  • NVIDIA GeForce RTX 5090,32 GB 显存
  • 检测到的模型类:MiniMaxH3TEModel_
  • 有限条件输出:(1, 12, 5120)
  • 正确的minimax_token_tags(12,)
  • 编码后显存:约分配 24.7 GiB / 保留 26.1 GiB
  • 标准CLIPLoader加载条件模型时恰好有 50 个语言层,且没有最终归一化层或 LM 头。
  • 可选后缀路径通过所有 64 层生成一个词元,返回完全相同的 CLIP 对象,然后使其保持在恰好 50 层且无归一化头/ LM 头的状态。
  • 后缀部分卸载后,返回的 CLIP 成功编码了 MiniMax 条件:有限输出(1, 4, 5120)且带有词元标签。
  • 无后缀路径使用完整的 Qwen3-VL-4B ComfyUI CLIP 进行了测试,并在未加载 MiniMax 后缀的情况下成功生成。

所使用的本地 CUDA 12.8 PyTorch 构建使用了回退操作,因为此comfy-kitchen版本推荐 CUDA 13.0+ 以使用其优化内核。尽管如此,编码仍然成功完成。建议使用当前 ComfyUI 环境及其推荐的 PyTorch 构建。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#provenance来源

固定的上游源:

repository: llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic revision: c44b949b30d111666a5ed9851c5cd633ed39b070

两个上游 BF16 分片均在该修订版本下载,并在打包前根据其 Hugging Face LFS SHA-256 值进行了验证。

源模型卡报告了针对语言层 31–40 中attn.o_proj的 Heretic v1.2.0 ARA 编辑。所有这些被编辑的层都位于 MiniMax-H3 保留的 0–49 范围内,因此本检查点中包含这些未经审查的编辑。源报告显示拒绝率为 4/100,而原始模型为 99/100,KL 散度为 0.0421,PIQA 为 92.87%,MMLU 为 79.87%。

Abliteration 能减少拒答行为,但不保证会移除所有拒答或安全行为,并且可能影响模型质量。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#conversion转换

MiniMax-H3 BF16 包使用silveroxides/convert_to_quant(https://github.com/silveroxides/convert_to_quant)1.3.1 版本转换。成功构建使用了 AdamW AdaRound 优化和平台期早停,而不是简单舍入:

env PYTHONPATH=.deps python .deps/bin/ctq \ -i qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_bf16.safetensors \ -o qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --custom-layers '^model\.embed_tokens\.weight$' \ --custom-type int8 \ --custom-scaling-mode tensor \ --custom-simple \ --exclude-layers '^visual\.' \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL

语言块矩阵使用学习得到的 ConvRot。只有词元嵌入使用简单的张量级 INT8,因为 ComfyUI 嵌入查找需要该布局。视觉塔以 BF16 精确保留。

生成后缀部分是从同一固定源打包并单独转换的:

env PYTHONPATH=.deps .deps/bin/ctq \ -i qwen3vl_32b_minimax_h3_generation_tail_50_63_bf16.safetensors \ -o qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL \ --layer-config tools/qwen3vl32b_generation_tail_quant.json \ --fullmatch

98 个 transformer 矩阵使用学习得到的 AdamW ConvRot。LM 头使用简单的行级 ConvRot,以便增强器能够以小分块计算其 151,936 个输出行,避免多 GB 的临时反量化峰值。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#validation验证

完成的文件通过了每个张量、数据类型、形状、缩放因子、逐层描述符和全局量化元数据条目的结构验证。所有 551 个受保护的 BF16 张量与打包的 BF16 源进行了逐字节比较,并且没有变化。

后缀部分也通过了精确的结构验证:保留的 57 个 BF16 张量(304,128 字节)与源逐字节相同;其 99 个 INT8 权重、缩放因子、描述符和全局量化元数据均与声明的布局一致。将基础源拓扑(902 个张量)与后缀源拓扑(156 个张量)组合后,可重建完整模型的所有 1,058 个张量,且没有键冲突。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot#credits致谢

  • 未经审查的源和评估:llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic(https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic)
  • 原始模型:Qwen/Qwen3-VL-32B-Instruct(https://huggingface.co/Qwen/Qwen3-VL-32B-Instruct)
  • 量化工具:silveroxides/convert_to_quant(https://github.com/silveroxides/convert_to_quant)

相似文章

sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

Hugging Face Models Trending

发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。

Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot

Hugging Face Models Trending

该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。

Kijai/MiniMax-H3_comfy

Hugging Face Models Trending

一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。

drbaph/MiniMax-H3-Turbo-Lora-ComfyUI

Hugging Face Models Trending

MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。