AtomicChat/Qwen3.8-Flash-Next-GGUF 真的非常好
摘要
AtomicChat 对 Qwen3.8-Flash-Next-GGUF 的量化显著降低了内存使用,从 106GB 减少到 65GB,同时保持了良好的推理性能,使其在硬件受限的环境中更高效。
规格 硬件:M4 Max 128GB Studio 推理引擎:llama.cpp(qwen4exp 分支) 评判者:claude-opus-4-6 AtomicChat/Qwen3.8-Flash-Next-GGUF Qwen3.8-Flash-Next 是一个很好的模型,我在之前的帖子中测试过,但它非常紧张,因为所有的 n-grams / PLE 都与专家一起加载,占用 106GB,留给 K/V、上下文等的空间非常少。目前在 oMLX 上将 PLE 卸载到 SSD 会将预填充速度从 600 t/s 降低到 180 t/s。u/erikdhoward 建议尝试 Atomic Chat 量化,我对此一无所知。我试了一下,它……真的非常好。AtomicChat 的量化使用 llama.cpp mmap(通过 GGUF 分片布局与运行时中),并将 PLE 表(n-grams)保持为可分页的,由文件支持。因此,同样占用 106GB 的模型,现在在 RAM 中只占 65GB(从 55GB 开始)。而且由于 PLE 是可分页的,预填充实际上并不那么差,冷启动大约是 500 t/s。oMLX "right behind you!" Qwen3.8-Flash-Next 刚刚发布,oMLX 中有许多打开的 PR 来解决大小和性能问题,包括这个使 PLE 卸载 SSD 冷预填充速度提高近 3 倍 🎉
相似文章
Qwen3.8-Flash-Next. 一旦权重发布,这个架构可能会出人意料地适合本地运行。 👀
本文提供了Qwen3.8-Flash-Next模型的内存估计,表明通过量化技术,它可能适合本地运行。
我想试试 qwen 3.8... 但大家用的是哪个 GGUF 版本?
一位用户讨论为 Qwen 3.8 AI 模型选择合适的 GGUF 量化变体以在 32 GB 显存下获得良好性能的挑战,寻求社区推荐。
orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF
本文发布未经审查的 Qwen3.8-Flash-Next 模型的 GGUF 量化版本,这是 Qwen4 架构的混合专家模型预览版,专为支持视觉功能的 llama.cpp 设计,需要自定义构建以确保兼容性。
@rohanpaul_ai:atomic[.]chat 刚刚发布了 DeepSeek V4 Flash 0731 的 14 个压缩量化构建版本。从无损 BF16 到 1 位,GGUF……
atomic.chat 发布了 DeepSeek V4 Flash 0731 的 14 个量化 GGUF 构建版本,从无损 BF16 到 1 位。他们推荐在 128GB 硬件上使用 AD-IQ2_M,该版本在 83.6% 的情况下与原始模型的 token 选择一致。
Qwen3.8 Flash 量化模型
作者发布了兼容主线的Qwen3.8-Flash-Next模型的imatrix量化版本,提供比竞品小20-30GB的体积,同时保持竞争力的PPL,并为AMD硬件提供了单独的ROCm构建。