Qwen3.8 Flash 量化模型
摘要
作者发布了兼容主线的Qwen3.8-Flash-Next模型的imatrix量化版本,提供比竞品小20-30GB的体积,同时保持竞争力的PPL,并为AMD硬件提供了单独的ROCm构建。
比Unsloth/AesSedai Q4小约20-30GB,PPL相似。经过几天的测试,我发布了一套兼容主线的Qwen3.8-Flash-Next imatrix量化版本。目标:与流行的Unsloth / AesSedai Q4构建保持相同的质量水平,减少磁盘和内存占用。根据比较的文件不同,节省大约20-30GB。PPL在模型卡片中,与两者都具有竞争力。仓库:https://huggingface.co/agentionai/Qwen3.8-Flash-Next-AP-GGUF Q4量化版本是我建议的起点。Q3和Q5版本即将推出。配方是针对每一层定制的,而不是简单的降低位宽。AMD / Strix Halo:单独的ROCmFP4构建,在该硬件上比Q4_XS稍好且更快。(https://huggingface.co/agentionai/Qwen3.8-Flash-Next-ROCmFP4-FAST-imatrix-GGUF) 如果你尝试了,请分享你的量化版本、RAM/VRAM、tok/s,以及质量是否感觉与Unsloth IQ4_XS / Q4_K相当。这是我关心的比较。
相似文章
Qwen3.8 Flash AP Quants
该帖子宣布了Qwen3.8 Flash模型的新量化版本,通过改进的KLD测量和优化的预填充性能,超越了其他高质量量化版本。
Qwen 3.5 122B Heretic ROCmFP4 iMatrix
Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。
Qwen3.8-Flash-Next: 一种新架构,迈向极致成本效率
Qwen3.8-Flash-Next 引入了一种新的人工智能架构,专注于实现模型性能的极致成本效率。
Qwen3.8-Flash-Next. 一旦权重发布,这个架构可能会出人意料地适合本地运行。 👀
本文提供了Qwen3.8-Flash-Next模型的内存估计,表明通过量化技术,它可能适合本地运行。
Qwen/Qwen3.8-Flash-Next
发布 Qwen3.8-Flash-Next,一款开放权重的 AI 模型,引入混合注意力(Hybrid Attention)与 QSA 以及门控残差(Gated Residual)等架构创新,提升效率和可扩展性,预览未来的 Qwen4 架构。