大家忽略了 Qwen 3.8 27B Q2 + Q2 DFlash + Q5 KV 的实力
摘要
一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。
好的,补充一点背景信息:这实际上是针对 Qwen 3.8 27B 的 QAT Q2:https://huggingface.co/sdkyuan/qwen3.8-27B-qat-q2_0-gguf 针对 DFlash 模型的 QAT Q2:https://huggingface.co/HermiHg/Qwen3.8-27B-DFlash2-Q2_K_S-MIX-GGUF Q5 KV 对我来说似乎没有任何问题;我已使用它处理高达 200K token 的上下文。总内存使用量大约在 13-14 GB 左右,使用 QAT Q2 3.8 27B 时,我几乎没有看到性能下降。这简直太疯狂了,现在用一张 12GB 显卡(如果降低上下文到 100K 就能装下),就能运行一个比 Sonnet 4.6 更强大的模型,真是不可思议的事情。
相似文章
@cyrilXBT: 太不可思议了。Qwen 3.8 27B 现在在本地 RTX 4060 上仅用 8GB 显存就能愉快运行。你看到的这是一个 64k 上下文…
一位用户分享称,Qwen 3.8 27B 模型通过 Unsloth 的 IQ4_XS 量化,在仅有 8GB 显存的 RTX 4060 上本地运行,实现了 64k 上下文窗口和令人印象深刻的性能指标。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
7900XTX 24GB 显存,终于能够在 131k 上下文下容纳 Q6K+MTP 和 Qwen 3.6 27B
在 AMD 7900XTX 上优化显存使用的指南,通过编译带有 OpenBLAS 和 CUDA_FA_ALL_QUANTS 的 llama.cpp,并使用 q5_0/q4_0 的 KVCache 量化,以运行使用 Q6K 量化和 131k 上下文的 27B Qwen 模型。
在6GB显存和16GB系统内存上运行Qwen 3.8 flash next的体验
一位用户分享了在配备6GB显存和16GB内存的系统上使用llama.cpp运行Qwen 3.8 flash next模型的体验,通过1位量化实现了6-7个每秒的生成速度,并寻求量化变体的推荐。
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。