ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot
摘要
一个Hugging Face仓库,提供未经审查的Qwen3-VL-32B变体的ComfyUI safetensors检查点,包含BF16和INT8 ConvRot H3条件编码器以及可选的生成尾部。
查看缓存全文
缓存时间: 2026/08/05 07:37
ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot · Hugging Face
来源: https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#qwen3-vl-32b-ultra-uncensored-heretic–h3-comfyui-bf16–int8-convrotQwen3-VL-32B Ultra Uncensored Heretic — H3 ComfyUI BF16 + INT8 ConvRot
本仓库包含三个由llmfan46/Qwen3\-VL\-32B\-Instruct\-ultra\-uncensored\-heretic (https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic) 构建的 ComfyUI safetensors 文件。
- H3 文本/视觉条件编码器的 BF16 和 INT8 ConvRot 变体,包含语言层 0–49;以及
- 一个可选的仅用于生成的尾部,包含第 50–63 层、最终归一化层和 LM 头,用于提示增强。
H3 使用语言层 49 之后的未归一化隐藏状态。因此,该检查点包含 Qwen3-VL 嵌入层、语言层 0–49 以及完整的视觉塔。它有意省略了语言层 50–63、最终语言归一化层和 LM 头。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#h3-conditioning-encoder–bf16H3 条件编码器 — BF16
qwen3vl\_32b\_h3\_ultra\_uncensored\_heretic\_bf16\.safetensors
- 大小:51,506,295,440 字节 (47.97 GiB)
- SHA-256:
bbcd92a732e911cfafd86960e0e26aacc6efe949e02f16a9641f201c62984860 - 902 个张量,全部为 BF16
- Qwen3-VL 嵌入层和语言层 0–49
- 完整视觉塔
- 有意排除第 50–63 层、最终语言归一化层和 LM 头
这是用于创建下方 ConvRot 构建的全精度源文件。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#h3-conditioning-encoder–int8-convrotH3 条件编码器 — INT8 ConvRot
qwen3vl\_32b\_h3\_ultra\_uncensored\_heretic\_int8\_convrot\.safetensors
- 大小:26,363,476,151 字节 (24.55 GiB)
- SHA-256:
d84547412144b7c50a6ec77437a889b869d3ace88da77ef1775d3d2a4901c192 - 1,604 个张量
- 350 个学习得到的行式 INT8 ConvRot 语言矩阵
- 每个学习得到的语言矩阵的 ConvRot 组大小为 256
- 一个简单的张量式 INT8 词元嵌入
- 551 个张量保留为 BF16,包括完整视觉塔和所有归一化层
- 351 个 FP32 权重缩放因子和 351 个 ComfyUI 量化描述符
在内存允许的情况下使用 BF16。INT8 ConvRot 构建适用于 47.97 GiB 条件编码器过大的系统。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#optional-prompt-enhancement-tail可选的提示增强尾部
qwen3vl\_32b\_h3\_generation\_tail\_50\_63\_int8\_convrot\.safetensors
- 大小:7,609,128,707 字节 (7.09 GiB)
- SHA-256:
b5bb9bb8dc87cf11cbee241a2d95d6d42fe52cf695ed26c093ac321f31160b20 - 354 个张量
- 语言层 50–63、最终语言归一化层和 LM 头
- 98 个学习得到的行式 INT8 ConvRot 矩阵
- 一个简单的行式 INT8 ConvRot LM 头,由节点分块计算
- ConvRot 组大小为 256
- 57 个张量精确保留为 BF16
该尾部不是独立的 CLIP,也不重复词元嵌入或视觉塔。它由兼容的 H3 Guide 节点临时加载,并重用连接的标准 H3 CLIP 中的 0–49 层。生成后,它会被卸载,原始条件 CLIP 保持不变。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#comfyui-installationComfyUI 安装
将所选的条件编码器和可选尾部放在:
ComfyUI/models/text_encoders/H3/
在CLIPLoader中选择它,并使用 H3 兼容的文本编码器类型。使用当前的 ComfyUI 检出及其固定的comfy\-kitchen依赖。
进行提示增强:
- 使用 ComfyUI 的标准
CLIPLoader和 H3 兼容的文本编码器类型加载 0–49 层条件检查点。 - 将该 CLIP 连接到H3 Prompt Enhancer(可选 CLIP 尾部)。
- 在节点的
clip\_tail下拉菜单中选择 50–63 层尾部。 - 将
enhanced\_prompt和返回的、未更改的clip发送到正常的 H3 guide 节点。
如果连接的 CLIP 已经是一个完整的生成模型,请将clip\_tail保留为[none — connected CLIP is already complete]。然后增强器会调用所连接 CLIP 的普通generate()路径,而不会加载或需要此尾部。
这些是 ComfyUI 检查点,而不是完整的 Transformers 生成仓库。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#runtime-verification运行时验证
条件检查点和增强器通过了实际运行时测试:
- ComfyUI 提交:
14b05228cef127ce529bc0c08660770d4af3e9a8 comfy\-kitchen==0\.2\.26comfy\-aimdo==0\.4\.11- PyTorch
2\.8\.0\+cu128 - NVIDIA GeForce RTX 5090,32 GB VRAM
- 检测到 H3 兼容的文本编码器模型类
- 有限的条件输出:
\(1, 12, 5120\) - 正确的模态词元标签:
\(12,\) - 编码后 VRAM:约 24.7 GiB 已分配 / 26.1 GiB 已预留
- 标准
CLIPLoader加载了条件模型,恰好有 50 个语言层,没有最终归一化层或 LM 头。 - 可选的尾部路径通过所有 64 层生成了一个词元,返回了完全相同的 CLIP 对象,然后使其保持恰好 50 层,没有归一化层/头。
- 尾部卸载后,返回的 CLIP 成功编码了 H3 条件:具有词元标签的有限
\(1, 4, 5120\)输出。 - 无尾部路径使用完整的 Qwen3-VL-4B ComfyUI CLIP 进行了测试,并在不加载 H3 尾部的情况下成功生成。
本地的 CUDA 12.8 PyTorch 构建使用了回退操作,因为此comfy\-kitchen版本推荐使用 CUDA 13.0+ 来运行其优化内核。尽管如此,编码仍然成功完成。建议使用当前的 ComfyUI 环境及其推荐的 PyTorch 构建。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#provenance来源
固定的上游源:
repository: llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic revision: c44b949b30d111666a5ed9851c5cd633ed39b070
两个上游 BF16 分片均在该修订版下载,并在打包前根据其 Hugging Face LFS SHA-256 值进行了验证。
源模型卡报告了针对语言层 31–40 中attn\.o\_proj的 Heretic v1.2.0 ARA 编辑。所有这些被编辑的层都位于 H3 保留的 0–49 范围内,因此取消审查编辑存在于该检查点中。源报告显示,拒绝率为 4/100,而原始模型为 99/100,KL 散度为 0.0421,PIQA 为 92.87%,MMLU 为 79.87%。
Abliteration 会减少拒绝行为,但并不能保证所有拒绝或安全行为都被移除,并且可能会影响模型质量。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#conversion转换
H3 BF16 包是使用silveroxides/convert\_to\_quant (https://github.com/silveroxides/convert_to_quant) 1.3.1 转换的。成功的构建使用了带平台早停的 AdamW AdaRound 优化,而非简单舍入:
env PYTHONPATH=.deps python .deps/bin/ctq \ -i qwen3vl_32b_h3_ultra_uncensored_heretic_bf16.safetensors \ -o qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --custom-layers '^model\.embed_tokens\.weight$' \ --custom-type int8 \ --custom-scaling-mode tensor \ --custom-simple \ --exclude-layers '^visual\.' \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL
语言块矩阵使用学习得到的 ConvRot。只有词元嵌入使用简单的张量式 INT8,因为 ComfyUI 嵌入查找要求该布局。视觉塔精确保留为 BF16。
生成尾部是从相同的固定源打包并单独转换的:
env PYTHONPATH=.deps .deps/bin/ctq \ -i qwen3vl_32b_h3_generation_tail_50_63_bf16.safetensors \ -o qwen3vl_32b_h3_generation_tail_50_63_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL \ --layer-config tools/qwen3vl32b_generation_tail_quant.json \ --fullmatch
98 个 transformer 矩阵使用学习得到的 AdamW ConvRot。LM 头使用简单的行式 ConvRot,以便增强器可以分小块计算其 151,936 个输出行,并避免数 GB 的临时去量化峰值。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#validation验证
完成的文件通过了每个张量、数据类型、形状、缩放因子、逐层描述符和全局量化元数据条目的结构验证。所有 551 个受保护的 BF16 张量都与打包的 BF16 源进行了逐字节比较,并且未更改。
尾部也通过了精确的结构验证:保留的 57 个 BF16 张量(304,128 字节)与源逐字节相同;其 99 个 INT8 权重、缩放因子、描述符和全局量化元数据均与声明的布局匹配。将基本源拓扑(902 个张量)与尾部源拓扑(156 个张量)组合,可以重建完整模型的所有 1,058 个张量,且没有键冲突。
https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#credits致谢
- 未审查源和评估:
llmfan46/Qwen3\-VL\-32B\-Instruct\-ultra\-uncensored\-heretic(https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic) - 原始模型:
Qwen/Qwen3\-VL\-32B\-Instruct(https://huggingface.co/Qwen/Qwen3-VL-32B-Instruct) - 量化工具:
silveroxides/convert\_to\_quant(https://github.com/silveroxides/convert_to_quant)
相似文章
ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。
sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。
HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
在 Hugging Face 上发布 Qwen3.6-35B-A3B 模型的无审查激进变体,采用自定义 K_P 量化并完全移除了安全拒绝机制。
havenoammo/Qwen3.6-27B-MTP-UD-GGUF
该 Hugging Face 仓库提供了 Qwen3.6-27B 的 GGUF 文件,这些文件在 Unsloth UD XL 量化版本的基础上嫁接了多 Token 预测 (MTP) 层。它还包含了构建支持 MTP 的 llama.cpp 的说明,以实现投机解码。
Kijai/MiniMax-H3_comfy
一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。