Qwen 3.5 122B Heretic ROCmFP4 iMatrix
摘要
Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。
查看缓存全文
缓存时间: 2026/07/15 03:41
vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF · Hugging Face
来源: https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#qwen35-122b-a10b-heretic-%C2%B7-rocmfp4-imatrixQwen3.5 122B-A10B Heretic · ROCmFP4 iMatrix
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#a-compact-importance-calibrated-rocmfp4-build-for-high-memory-amd-systems面向高内存AMD系统的紧凑型重要性校准ROCmFP4构建
122B总参数量 · 10B活跃参数 · 60.70 GiB · 原生28.45 tok/s · MTP 33.68 tok/s · BF16 KLD 0.100716 · PP 353.3 W/MTP 328.6 t/s
此GGUF使用自定义ROCmFP4张量类型。它需要ROCmFPX (https://github.com/charlie12345/ROCmFPX)或具备等效支持的其他运行时;标准的
llama.cpp、Ollama、LM Studio等运行时无法加载。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#downloads下载
浏览所有仓库文件 → (https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF/tree/main)
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#what-it-is这是什么
这是基于完整权重Qwen3.5 122B-A10B Heretic检查点的iMatrix校准量化版本。它使用ROCmFPX的紧凑型Q4_0_ROCMFP4_STRIX_LEAN配方构建,但公共文件名中已省略面向硬件的预设名称。
结果BF16平均KLD0.100716 ± 0.003407双西格玛KLD上界0.107530iMatrix带来的改进KLD降低14.01%贪婪解码28.448 tok/s带MTP的贪婪解码33.677 tok/s4,277令牌预填充****350.248 tok/s
主模型完整且可独立运行。包含23个张量、单层的MTP文件是一个可选的外部伴生文件;主GGUF中未嵌入MTP层。运行时将此角色称为草稿模型,但公共文件名中省略了Draft,因为这不意味着未完成。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#quality质量
校准模型及其未校准对照版本在ROCm0上对来自精确BF16父模型的相同保存分布进行了重放。
构建平均KLD PPL比率 相同Top RMS ΔpiMatrix0.100716 ± 0.0034071.080217 ± 0.010198****87.629% ± 0.622%****10.881%未校准0.117119 ± 0.004183 1.109251 ± 0.011299 86.774% ± 0.640% 12.077% iMatrix校准将平均KLD降低了14.01%,PPL比率降低了0.029034,相同Top一致性提高了0.855个百分点。双西格玛KLD上界为0.107530,低于选定的0.126性能导向目标。
成对重放涉及11个完整的512令牌块和2,805个评估后的下一个令牌分布。这些数据是从一次中断的32个块BF16运行中的精确概率块边界处恢复的。这是有用的初步证据,并非完整的32块验收门限。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#performance性能
在128 GB AMD Strix Halo系统上测量,使用Vulkan/RADV,上下文大小131,072,并行度1,批处理/微批处理2048/1024,Q8_0 KV缓存,flash attention,MTP关闭。数值为多次运行的中位数。
工作负载重复次数解码 提示处理贪婪,生成256个令牌528.448 tok/s71.929 tok/s采样,生成256个令牌328.418 tok/s71.294 tok/s4,277令牌预填充 + 生成128个令牌328.041 tok/s****350.248 tok/s 相对于匹配的未校准构建,解码分别提升了2.43%、5.23%和2.84%。长提示预填充变化为-1.03%。这些是单系统测量结果,不构成通用性能保证。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#optional-mtp-acceleration可选的MTP加速
外部MTP伴生模型与此精确iMatrix主干进行了匹配的MTP关/开A/B测试。模型、运行时、上下文、缓存、批处理几何、提示以及伴生模型标识保持不变;仅MTP执行方式改变。
工作负载原生解码MTP解码解码增益接受率端到端增益贪婪,256个令牌28.328 tok/s**33.677 tok/s****+18.89%85.03%+16.44%采样,256个令牌28.035 tok/s30.953 tok/s****+10.41%80.00%+8.76%4,277令牌预填充 + 12827.585 tok/s33.752 tok/s****+22.36%**90.73%-0.45% MTP使提示处理吞吐量降低约7%,因为伴生模型需要追赶提示。因此,当生成长度足够偿还固定成本时,MTP帮助最大。精确标识探测未改变,且MTP关和开通道均通过了技术散文、可执行代码语义、严格JSON、工具调用、均衡分析和防御安全冒烟测试。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#quantization量化
该模型使用包含339块的代码/技术重要性矩阵以及Q4_0_ROCMFP4_STRIX_LEAN预设,对经过验证的BF16 GGUF执行了一次量化。
张量类型数量Q4_0_ROCMFP4_FAST457Q4_0_ROCMFP460F32361Q5_K1
在此预设中,注意力K/V张量保留双尺度ROCmFP4保护,大多数Transformer权重使用紧凑的FAST布局,令牌嵌入/输出使用Q5_K。该产物包含879个张量,分布于48个块,且没有嵌入MTP层。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#run运行
llama-server \
--model Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix.gguf \
--host 127.0.0.1 --port 8080 \
-dev Vulkan0 --n-gpu-layers 999 \
--ctx-size 131072 --parallel 1 \
--flash-attn on --batch-size 2048 --ubatch-size 1024 \
--cache-type-k q8_0 --cache-type-v q8_0 \
--jinja --reasoning-format deepseek
根据你的内存预算调整上下文和缓存设置。测试运行时为charlie12345/ROCmFPX (https://github.com/charlie12345/ROCmFPX) 提交a6a93765f7ce9779c13f9881164a65f7a9f31198,在Release模式下针对gfx1151构建,启用了Vulkan和HIP,并包含本地Qwen3.5 MoE图修正。尚未使用更新的ROCmFPX版本进行验证。
要启用可选的伴生模型,请附加:
--spec-type draft-mtp \
--spec-draft-model Qwen3.5-122B-A10B-Heretic-ROCmFP4-MTP.gguf \
--spec-draft-device Vulkan0 --spec-draft-ngl 999 \
--spec-draft-type-k f16 --spec-draft-type-v f16 \
--spec-draft-n-max 2 --spec-draft-p-min 0.6 \
--spec-draft-p-split 0.10 --spec-draft-backend-sampling
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#tested-system测试系统
平台AMD Strix Halo,128 GB统一内存GPU目标Radeon 8060S / gfx1151后端Vulkan / RADV内核Linux 6.17.0-1028-oemMesa25.2.8
不包含视觉投影仪;该版本仅支持文本。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#lineage-and-credits沿革与致谢
本仓库的存在得益于多位人士公开发布的重要工作。他们的角色被明确区分,以便下游用户能够找到原始来源。
- **官方基础模型:**Qwen/Qwen3.5-122B-A10B (https://huggingface.co/Qwen/Qwen3.5-122B-A10B),Apache 2.0许可。
- **完整权重Heretic来源:**trohrbaugh/Qwen3.5-122B-A10B-heretic (https://huggingface.co/trohrbaugh/Qwen3.5-122B-A10B-heretic),通过固定的CCSSNE镜像 (https://huggingface.co/CCSSNE/trohrbaugh-Qwen3.5-122B-A10B-heretic) 获取,提交
fd6d6bc89e9be47577736c952dd4d1d7c830f09f。 - **MTP张量来源:**OptimizeLLM/Qwen3.5-122B-A10B-heretic-MTP-NVFP4 (https://huggingface.co/OptimizeLLM/Qwen3.5-122B-A10B-heretic-MTP-NVFP4),提交
07b7c2101c33f23a84fd3c618d00f17ea12269c3;其模型卡报告MTP张量是从官方Qwen检查点恢复的。 - **Heretic软件与方法:**p-e-w/heretic (https://github.com/p-e-w/heretic),由Philipp Emanuel Weidmann创建。源检查点报告Heretic v1.2.0。
- **相关的完整权重Heretic参考:**scrunter/Qwen3-VL-235B-A22B-Thinking-heretic (https://huggingface.co/scrunter/Qwen3-VL-235B-A22B-Thinking-heretic)。此相关的235B模型并非本版本的张量来源。
- **ROCmFP4实现、量化器及运行时:**charlie12345/ROCmFPX (https://github.com/charlie12345/ROCmFPX)。
- **Strix Halo部署栈:**hec-ovi/llama-vulkan-strix (https://github.com/hec-ovi/llama-vulkan-strix)。
- **发布灵感来源:**plunderstruck/Qwen3.6-27B-MTP-ROCmFP4-GGUF (https://huggingface.co/plunderstruck/Qwen3.6-27B-MTP-ROCmFP4-GGUF)。
- 转换、验证、基准测试及打包:
vmlinux。
在重新分发衍生作品时,请保留此沿革、Apache 2.0许可以及你所做的更改说明。
https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#license许可
本衍生模型作品根据上游Apache License 2.0提供。包含的LICENSE文件来自固定的完整权重来源。运行时和工具仓库保留各自的许可证:Heretic软件使用AGPL-3.0,而ROCmFPX和部署工具分别独立授权。本模型仓库中未捆绑任何运行时源代码。
相似文章
双Radeon R9700——在llama.cpp上运行Qwen 3.6 27B Q8 MTP
关于在使用ROCm的llama.cpp上,于双AMD Radeon R9700配置下运行Qwen 3.6 27B Q8模型的技术报告,包括性能基准测试和配置详情。
@Italianclownz: 已将 Qwen 3.6 35b a3b 转换为 ROCmfp4,运行飞快。使用了 mtp 版本,因为此 ROCmfp4 也可以融合 MTP 的优势…
将 Qwen 3.6 35b a3b 模型转换为 ROCmfp4 格式,利用 MTP 优势提升 AMD 硬件上的性能。
在24GB显存环境中运行Qwen 3.6 27B的配置:后端对比、量化选择与设置(llama.cpp, ik_llama.cpp, BeeLlama, vllm)
本文对比了在RTX 3090 24GB上运行Qwen 3.6 27B使用的llama.cpp后端,发现搭配IQ4_KS量化的ik_llama.cpp性能最佳(预填充1261 tok/s,解码72.9 tok/s)。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
TurboQuant+MTP在ROCm(Llama CPP)上的实现
一位开发者成功在llama.cpp中让TurboQuant TBQ4 KV缓存和多Token预测在AMD ROCm上针对RDNA3 GPU运行,实现在24GB显存上支持64k上下文,并具有有竞争力的token速率。