ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot

Hugging Face Models Trending 模型

摘要

一个Hugging Face仓库,提供未经审查的Qwen3-VL-32B变体的ComfyUI safetensors检查点,包含BF16和INT8 ConvRot H3条件编码器以及可选的生成尾部。

任务:图像-文本到文本 标签:comfyui, h3, qwen3-vl, qwen3-vl-32b, heretic, abliterated, 无审查, bf16, int8, convrot, 量化, 图像-文本到文本, en, base_model:llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic, base_model:finetune:llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:37

ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot · Hugging Face

来源: https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#qwen3-vl-32b-ultra-uncensored-heretic–h3-comfyui-bf16–int8-convrotQwen3-VL-32B Ultra Uncensored Heretic — H3 ComfyUI BF16 + INT8 ConvRot

本仓库包含三个由llmfan46/Qwen3\-VL\-32B\-Instruct\-ultra\-uncensored\-heretic (https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic) 构建的 ComfyUI safetensors 文件。

  • H3 文本/视觉条件编码器的 BF16 和 INT8 ConvRot 变体,包含语言层 0–49;以及
  • 一个可选的仅用于生成的尾部,包含第 50–63 层、最终归一化层和 LM 头,用于提示增强。

H3 使用语言层 49 之后的未归一化隐藏状态。因此,该检查点包含 Qwen3-VL 嵌入层、语言层 0–49 以及完整的视觉塔。它有意省略了语言层 50–63、最终语言归一化层和 LM 头。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#h3-conditioning-encoder–bf16H3 条件编码器 — BF16

qwen3vl\_32b\_h3\_ultra\_uncensored\_heretic\_bf16\.safetensors

  • 大小:51,506,295,440 字节 (47.97 GiB)
  • SHA-256:bbcd92a732e911cfafd86960e0e26aacc6efe949e02f16a9641f201c62984860
  • 902 个张量,全部为 BF16
  • Qwen3-VL 嵌入层和语言层 0–49
  • 完整视觉塔
  • 有意排除第 50–63 层、最终语言归一化层和 LM 头

这是用于创建下方 ConvRot 构建的全精度源文件。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#h3-conditioning-encoder–int8-convrotH3 条件编码器 — INT8 ConvRot

qwen3vl\_32b\_h3\_ultra\_uncensored\_heretic\_int8\_convrot\.safetensors

  • 大小:26,363,476,151 字节 (24.55 GiB)
  • SHA-256:d84547412144b7c50a6ec77437a889b869d3ace88da77ef1775d3d2a4901c192
  • 1,604 个张量
  • 350 个学习得到的行式 INT8 ConvRot 语言矩阵
  • 每个学习得到的语言矩阵的 ConvRot 组大小为 256
  • 一个简单的张量式 INT8 词元嵌入
  • 551 个张量保留为 BF16,包括完整视觉塔和所有归一化层
  • 351 个 FP32 权重缩放因子和 351 个 ComfyUI 量化描述符

在内存允许的情况下使用 BF16。INT8 ConvRot 构建适用于 47.97 GiB 条件编码器过大的系统。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#optional-prompt-enhancement-tail可选的提示增强尾部

qwen3vl\_32b\_h3\_generation\_tail\_50\_63\_int8\_convrot\.safetensors

  • 大小:7,609,128,707 字节 (7.09 GiB)
  • SHA-256:b5bb9bb8dc87cf11cbee241a2d95d6d42fe52cf695ed26c093ac321f31160b20
  • 354 个张量
  • 语言层 50–63、最终语言归一化层和 LM 头
  • 98 个学习得到的行式 INT8 ConvRot 矩阵
  • 一个简单的行式 INT8 ConvRot LM 头,由节点分块计算
  • ConvRot 组大小为 256
  • 57 个张量精确保留为 BF16

该尾部不是独立的 CLIP,也不重复词元嵌入或视觉塔。它由兼容的 H3 Guide 节点临时加载,并重用连接的标准 H3 CLIP 中的 0–49 层。生成后,它会被卸载,原始条件 CLIP 保持不变。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#comfyui-installationComfyUI 安装

将所选的条件编码器和可选尾部放在:

ComfyUI/models/text_encoders/H3/

CLIPLoader中选择它,并使用 H3 兼容的文本编码器类型。使用当前的 ComfyUI 检出及其固定的comfy\-kitchen依赖。

进行提示增强:

  1. 使用 ComfyUI 的标准CLIPLoader和 H3 兼容的文本编码器类型加载 0–49 层条件检查点。
  2. 将该 CLIP 连接到H3 Prompt Enhancer(可选 CLIP 尾部)
  3. 在节点的clip\_tail下拉菜单中选择 50–63 层尾部。
  4. enhanced\_prompt和返回的、未更改的clip发送到正常的 H3 guide 节点。

如果连接的 CLIP 已经是一个完整的生成模型,请将clip\_tail保留为[none — connected CLIP is already complete]。然后增强器会调用所连接 CLIP 的普通generate()路径,而不会加载或需要此尾部。

这些是 ComfyUI 检查点,而不是完整的 Transformers 生成仓库。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#runtime-verification运行时验证

条件检查点和增强器通过了实际运行时测试:

  • ComfyUI 提交:14b05228cef127ce529bc0c08660770d4af3e9a8
  • comfy\-kitchen==0\.2\.26
  • comfy\-aimdo==0\.4\.11
  • PyTorch2\.8\.0\+cu128
  • NVIDIA GeForce RTX 5090,32 GB VRAM
  • 检测到 H3 兼容的文本编码器模型类
  • 有限的条件输出:\(1, 12, 5120\)
  • 正确的模态词元标签:\(12,\)
  • 编码后 VRAM:约 24.7 GiB 已分配 / 26.1 GiB 已预留
  • 标准CLIPLoader加载了条件模型,恰好有 50 个语言层,没有最终归一化层或 LM 头。
  • 可选的尾部路径通过所有 64 层生成了一个词元,返回了完全相同的 CLIP 对象,然后使其保持恰好 50 层,没有归一化层/头。
  • 尾部卸载后,返回的 CLIP 成功编码了 H3 条件:具有词元标签的有限\(1, 4, 5120\)输出。
  • 无尾部路径使用完整的 Qwen3-VL-4B ComfyUI CLIP 进行了测试,并在不加载 H3 尾部的情况下成功生成。

本地的 CUDA 12.8 PyTorch 构建使用了回退操作,因为此comfy\-kitchen版本推荐使用 CUDA 13.0+ 来运行其优化内核。尽管如此,编码仍然成功完成。建议使用当前的 ComfyUI 环境及其推荐的 PyTorch 构建。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#provenance来源

固定的上游源:

repository: llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic revision: c44b949b30d111666a5ed9851c5cd633ed39b070

两个上游 BF16 分片均在该修订版下载,并在打包前根据其 Hugging Face LFS SHA-256 值进行了验证。

源模型卡报告了针对语言层 31–40 中attn\.o\_proj的 Heretic v1.2.0 ARA 编辑。所有这些被编辑的层都位于 H3 保留的 0–49 范围内,因此取消审查编辑存在于该检查点中。源报告显示,拒绝率为 4/100,而原始模型为 99/100,KL 散度为 0.0421,PIQA 为 92.87%,MMLU 为 79.87%。

Abliteration 会减少拒绝行为,但并不能保证所有拒绝或安全行为都被移除,并且可能会影响模型质量。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#conversion转换

H3 BF16 包是使用silveroxides/convert\_to\_quant (https://github.com/silveroxides/convert_to_quant) 1.3.1 转换的。成功的构建使用了带平台早停的 AdamW AdaRound 优化,而非简单舍入:

env PYTHONPATH=.deps python .deps/bin/ctq \ -i qwen3vl_32b_h3_ultra_uncensored_heretic_bf16.safetensors \ -o qwen3vl_32b_h3_ultra_uncensored_heretic_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --custom-layers '^model\.embed_tokens\.weight$' \ --custom-type int8 \ --custom-scaling-mode tensor \ --custom-simple \ --exclude-layers '^visual\.' \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL

语言块矩阵使用学习得到的 ConvRot。只有词元嵌入使用简单的张量式 INT8,因为 ComfyUI 嵌入查找要求该布局。视觉塔精确保留为 BF16。

生成尾部是从相同的固定源打包并单独转换的:

env PYTHONPATH=.deps .deps/bin/ctq \ -i qwen3vl_32b_h3_generation_tail_50_63_bf16.safetensors \ -o qwen3vl_32b_h3_generation_tail_50_63_int8_convrot.safetensors \ --int8 \ --scaling_mode row \ --convrot \ --convrot-group-size 256 \ --comfy_quant \ --save-quant-metadata \ --low-memory \ --device cuda \ --manual-seed 42 \ --num-iter 4000 \ --optimizer adamw \ --verbose NORMAL \ --layer-config tools/qwen3vl32b_generation_tail_quant.json \ --fullmatch

98 个 transformer 矩阵使用学习得到的 AdamW ConvRot。LM 头使用简单的行式 ConvRot,以便增强器可以分小块计算其 151,936 个输出行,并避免数 GB 的临时去量化峰值。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#validation验证

完成的文件通过了每个张量、数据类型、形状、缩放因子、逐层描述符和全局量化元数据条目的结构验证。所有 551 个受保护的 BF16 张量都与打包的 BF16 源进行了逐字节比较,并且未更改。

尾部也通过了精确的结构验证:保留的 57 个 BF16 张量(304,128 字节)与源逐字节相同;其 99 个 INT8 权重、缩放因子、描述符和全局量化元数据均与声明的布局匹配。将基本源拓扑(902 个张量)与尾部源拓扑(156 个张量)组合,可以重建完整模型的所有 1,058 个张量,且没有键冲突。

https://huggingface.co/ethanfel/Qwen3-VL-32B-Ultra-Heretic-H3-ComfyUI-INT8-ConvRot#credits致谢

  • 未审查源和评估:llmfan46/Qwen3\-VL\-32B\-Instruct\-ultra\-uncensored\-heretic (https://huggingface.co/llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic)
  • 原始模型:Qwen/Qwen3\-VL\-32B\-Instruct (https://huggingface.co/Qwen/Qwen3-VL-32B-Instruct)
  • 量化工具:silveroxides/convert\_to\_quant (https://github.com/silveroxides/convert_to_quant)

相似文章

ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot

Hugging Face Models Trending

该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。

sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

Hugging Face Models Trending

发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。

havenoammo/Qwen3.6-27B-MTP-UD-GGUF

Hugging Face Models Trending

该 Hugging Face 仓库提供了 Qwen3.6-27B 的 GGUF 文件,这些文件在 Unsloth UD XL 量化版本的基础上嫁接了多 Token 预测 (MTP) 层。它还包含了构建支持 MTP 的 llama.cpp 的说明,以实现投机解码。

Kijai/MiniMax-H3_comfy

Hugging Face Models Trending

一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。