Qwen3.8 Flash 量化模型

Reddit r/LocalLLaMA 模型

摘要

作者发布了兼容主线的Qwen3.8-Flash-Next模型的imatrix量化版本,提供比竞品小20-30GB的体积,同时保持竞争力的PPL,并为AMD硬件提供了单独的ROCm构建。

比Unsloth/AesSedai Q4小约20-30GB,PPL相似。经过几天的测试,我发布了一套兼容主线的Qwen3.8-Flash-Next imatrix量化版本。目标:与流行的Unsloth / AesSedai Q4构建保持相同的质量水平,减少磁盘和内存占用。根据比较的文件不同,节省大约20-30GB。PPL在模型卡片中,与两者都具有竞争力。仓库:https://huggingface.co/agentionai/Qwen3.8-Flash-Next-AP-GGUF Q4量化版本是我建议的起点。Q3和Q5版本即将推出。配方是针对每一层定制的,而不是简单的降低位宽。AMD / Strix Halo:单独的ROCmFP4构建,在该硬件上比Q4_XS稍好且更快。(https://huggingface.co/agentionai/Qwen3.8-Flash-Next-ROCmFP4-FAST-imatrix-GGUF) 如果你尝试了,请分享你的量化版本、RAM/VRAM、tok/s,以及质量是否感觉与Unsloth IQ4_XS / Q4_K相当。这是我关心的比较。
查看原文

相似文章

Qwen3.8 Flash AP Quants

Reddit r/LocalLLaMA

该帖子宣布了Qwen3.8 Flash模型的新量化版本,通过改进的KLD测量和优化的预填充性能,超越了其他高质量量化版本。

Qwen 3.5 122B Heretic ROCmFP4 iMatrix

Reddit r/LocalLLaMA

Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。

Qwen/Qwen3.8-Flash-Next

Hugging Face Models Trending

发布 Qwen3.8-Flash-Next,一款开放权重的 AI 模型,引入混合注意力(Hybrid Attention)与 QSA 以及门控残差(Gated Residual)等架构创新,提升效率和可扩展性,预览未来的 Qwen4 架构。