AtomicChat/Qwen3.8-Flash-Next-GGUF 真的非常好

Reddit r/LocalLLaMA 模型

摘要

AtomicChat 对 Qwen3.8-Flash-Next-GGUF 的量化显著降低了内存使用,从 106GB 减少到 65GB,同时保持了良好的推理性能,使其在硬件受限的环境中更高效。

规格 硬件:M4 Max 128GB Studio 推理引擎:llama.cpp(qwen4exp 分支) 评判者:claude-opus-4-6 AtomicChat/Qwen3.8-Flash-Next-GGUF Qwen3.8-Flash-Next 是一个很好的模型,我在之前的帖子中测试过,但它非常紧张,因为所有的 n-grams / PLE 都与专家一起加载,占用 106GB,留给 K/V、上下文等的空间非常少。目前在 oMLX 上将 PLE 卸载到 SSD 会将预填充速度从 600 t/s 降低到 180 t/s。u/erikdhoward 建议尝试 Atomic Chat 量化,我对此一无所知。我试了一下,它……真的非常好。AtomicChat 的量化使用 llama.cpp mmap(通过 GGUF 分片布局与运行时中),并将 PLE 表(n-grams)保持为可分页的,由文件支持。因此,同样占用 106GB 的模型,现在在 RAM 中只占 65GB(从 55GB 开始)。而且由于 PLE 是可分页的,预填充实际上并不那么差,冷启动大约是 500 t/s。oMLX "right behind you!" Qwen3.8-Flash-Next 刚刚发布,oMLX 中有许多打开的 PR 来解决大小和性能问题,包括这个使 PLE 卸载 SSD 冷预填充速度提高近 3 倍 🎉
查看原文

相似文章

orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

Hugging Face Models Trending

本文发布未经审查的 Qwen3.8-Flash-Next 模型的 GGUF 量化版本,这是 Qwen4 架构的混合专家模型预览版,专为支持视觉功能的 llama.cpp 设计,需要自定义构建以确保兼容性。

Qwen3.8 Flash 量化模型

Reddit r/LocalLLaMA

作者发布了兼容主线的Qwen3.8-Flash-Next模型的imatrix量化版本,提供比竞品小20-30GB的体积,同时保持竞争力的PPL,并为AMD硬件提供了单独的ROCm构建。