Qwen 3.5 122B Heretic ROCmFP4 iMatrix

Reddit r/LocalLLaMA 模型

摘要

Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/15 03:41

vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF · Hugging Face

来源: https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#qwen35-122b-a10b-heretic-%C2%B7-rocmfp4-imatrixQwen3.5 122B-A10B Heretic · ROCmFP4 iMatrix

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#a-compact-importance-calibrated-rocmfp4-build-for-high-memory-amd-systems面向高内存AMD系统的紧凑型重要性校准ROCmFP4构建

122B总参数量 · 10B活跃参数 · 60.70 GiB · 原生28.45 tok/s · MTP 33.68 tok/s · BF16 KLD 0.100716 · PP 353.3 W/MTP 328.6 t/s

此GGUF使用自定义ROCmFP4张量类型。它需要ROCmFPX (https://github.com/charlie12345/ROCmFPX)或具备等效支持的其他运行时;标准的llama.cpp、Ollama、LM Studio等运行时无法加载。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#downloads下载

浏览所有仓库文件 → (https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF/tree/main)

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#what-it-is这是什么

这是基于完整权重Qwen3.5 122B-A10B Heretic检查点的iMatrix校准量化版本。它使用ROCmFPX的紧凑型Q4_0_ROCMFP4_STRIX_LEAN配方构建,但公共文件名中已省略面向硬件的预设名称。

结果BF16平均KLD0.100716 ± 0.003407双西格玛KLD上界0.107530iMatrix带来的改进KLD降低14.01%贪婪解码28.448 tok/s带MTP的贪婪解码33.677 tok/s4,277令牌预填充****350.248 tok/s 主模型完整且可独立运行。包含23个张量、单层的MTP文件是一个可选的外部伴生文件;主GGUF中未嵌入MTP层。运行时将此角色称为草稿模型,但公共文件名中省略了Draft,因为这不意味着未完成。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#quality质量

校准模型及其未校准对照版本在ROCm0上对来自精确BF16父模型的相同保存分布进行了重放。

构建平均KLD PPL比率 相同Top RMS ΔpiMatrix0.100716 ± 0.0034071.080217 ± 0.010198****87.629% ± 0.622%****10.881%未校准0.117119 ± 0.004183 1.109251 ± 0.011299 86.774% ± 0.640% 12.077% iMatrix校准将平均KLD降低了14.01%,PPL比率降低了0.029034,相同Top一致性提高了0.855个百分点。双西格玛KLD上界为0.107530,低于选定的0.126性能导向目标。

成对重放涉及11个完整的512令牌块和2,805个评估后的下一个令牌分布。这些数据是从一次中断的32个块BF16运行中的精确概率块边界处恢复的。这是有用的初步证据,并非完整的32块验收门限。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#performance性能

在128 GB AMD Strix Halo系统上测量,使用Vulkan/RADV,上下文大小131,072,并行度1,批处理/微批处理2048/1024,Q8_0 KV缓存,flash attention,MTP关闭。数值为多次运行的中位数。

工作负载重复次数解码 提示处理贪婪,生成256个令牌528.448 tok/s71.929 tok/s采样,生成256个令牌328.418 tok/s71.294 tok/s4,277令牌预填充 + 生成128个令牌328.041 tok/s****350.248 tok/s 相对于匹配的未校准构建,解码分别提升了2.43%、5.23%和2.84%。长提示预填充变化为-1.03%。这些是单系统测量结果,不构成通用性能保证。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#optional-mtp-acceleration可选的MTP加速

外部MTP伴生模型与此精确iMatrix主干进行了匹配的MTP关/开A/B测试。模型、运行时、上下文、缓存、批处理几何、提示以及伴生模型标识保持不变;仅MTP执行方式改变。

工作负载原生解码MTP解码解码增益接受率端到端增益贪婪,256个令牌28.328 tok/s**33.677 tok/s****+18.89%85.03%+16.44%采样,256个令牌28.035 tok/s30.953 tok/s****+10.41%80.00%+8.76%4,277令牌预填充 + 12827.585 tok/s33.752 tok/s****+22.36%**90.73%-0.45% MTP使提示处理吞吐量降低约7%,因为伴生模型需要追赶提示。因此,当生成长度足够偿还固定成本时,MTP帮助最大。精确标识探测未改变,且MTP关和开通道均通过了技术散文、可执行代码语义、严格JSON、工具调用、均衡分析和防御安全冒烟测试。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#quantization量化

该模型使用包含339块的代码/技术重要性矩阵以及Q4_0_ROCMFP4_STRIX_LEAN预设,对经过验证的BF16 GGUF执行了一次量化。

张量类型数量Q4_0_ROCMFP4_FAST457Q4_0_ROCMFP460F32361Q5_K1 在此预设中,注意力K/V张量保留双尺度ROCmFP4保护,大多数Transformer权重使用紧凑的FAST布局,令牌嵌入/输出使用Q5_K。该产物包含879个张量,分布于48个块,且没有嵌入MTP层。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#run运行

llama-server \
  --model Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix.gguf \
  --host 127.0.0.1 --port 8080 \
  -dev Vulkan0 --n-gpu-layers 999 \
  --ctx-size 131072 --parallel 1 \
  --flash-attn on --batch-size 2048 --ubatch-size 1024 \
  --cache-type-k q8_0 --cache-type-v q8_0 \
  --jinja --reasoning-format deepseek

根据你的内存预算调整上下文和缓存设置。测试运行时为charlie12345/ROCmFPX (https://github.com/charlie12345/ROCmFPX) 提交a6a93765f7ce9779c13f9881164a65f7a9f31198,在Release模式下针对gfx1151构建,启用了Vulkan和HIP,并包含本地Qwen3.5 MoE图修正。尚未使用更新的ROCmFPX版本进行验证。

要启用可选的伴生模型,请附加:

--spec-type draft-mtp \
  --spec-draft-model Qwen3.5-122B-A10B-Heretic-ROCmFP4-MTP.gguf \
  --spec-draft-device Vulkan0 --spec-draft-ngl 999 \
  --spec-draft-type-k f16 --spec-draft-type-v f16 \
  --spec-draft-n-max 2 --spec-draft-p-min 0.6 \
  --spec-draft-p-split 0.10 --spec-draft-backend-sampling

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#tested-system测试系统

平台AMD Strix Halo,128 GB统一内存GPU目标Radeon 8060S / gfx1151后端Vulkan / RADV内核Linux 6.17.0-1028-oemMesa25.2.8 不包含视觉投影仪;该版本仅支持文本。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#lineage-and-credits沿革与致谢

本仓库的存在得益于多位人士公开发布的重要工作。他们的角色被明确区分,以便下游用户能够找到原始来源。

  • **官方基础模型:**Qwen/Qwen3.5-122B-A10B (https://huggingface.co/Qwen/Qwen3.5-122B-A10B),Apache 2.0许可。
  • **完整权重Heretic来源:**trohrbaugh/Qwen3.5-122B-A10B-heretic (https://huggingface.co/trohrbaugh/Qwen3.5-122B-A10B-heretic),通过固定的CCSSNE镜像 (https://huggingface.co/CCSSNE/trohrbaugh-Qwen3.5-122B-A10B-heretic) 获取,提交fd6d6bc89e9be47577736c952dd4d1d7c830f09f
  • **MTP张量来源:**OptimizeLLM/Qwen3.5-122B-A10B-heretic-MTP-NVFP4 (https://huggingface.co/OptimizeLLM/Qwen3.5-122B-A10B-heretic-MTP-NVFP4),提交07b7c2101c33f23a84fd3c618d00f17ea12269c3;其模型卡报告MTP张量是从官方Qwen检查点恢复的。
  • **Heretic软件与方法:**p-e-w/heretic (https://github.com/p-e-w/heretic),由Philipp Emanuel Weidmann创建。源检查点报告Heretic v1.2.0。
  • **相关的完整权重Heretic参考:**scrunter/Qwen3-VL-235B-A22B-Thinking-heretic (https://huggingface.co/scrunter/Qwen3-VL-235B-A22B-Thinking-heretic)。此相关的235B模型并非本版本的张量来源。
  • **ROCmFP4实现、量化器及运行时:**charlie12345/ROCmFPX (https://github.com/charlie12345/ROCmFPX)。
  • **Strix Halo部署栈:**hec-ovi/llama-vulkan-strix (https://github.com/hec-ovi/llama-vulkan-strix)。
  • **发布灵感来源:**plunderstruck/Qwen3.6-27B-MTP-ROCmFP4-GGUF (https://huggingface.co/plunderstruck/Qwen3.6-27B-MTP-ROCmFP4-GGUF)。
  • 转换、验证、基准测试及打包:vmlinux

在重新分发衍生作品时,请保留此沿革、Apache 2.0许可以及你所做的更改说明。

https://huggingface.co/vmlinux/Qwen3.5-122B-A10B-Heretic-ROCmFP4-iMatrix-GGUF#license许可

本衍生模型作品根据上游Apache License 2.0提供。包含的LICENSE文件来自固定的完整权重来源。运行时和工具仓库保留各自的许可证:Heretic软件使用AGPL-3.0,而ROCmFPX和部署工具分别独立授权。本模型仓库中未捆绑任何运行时源代码。

相似文章

TurboQuant+MTP在ROCm(Llama CPP)上的实现

Reddit r/LocalLLaMA

一位开发者成功在llama.cpp中让TurboQuant TBQ4 KV缓存和多Token预测在AMD ROCm上针对RDNA3 GPU运行,实现在24GB显存上支持64k上下文,并具有有竞争力的token速率。