我想试试 qwen 3.8... 但大家用的是哪个 GGUF 版本?
摘要
一位用户讨论为 Qwen 3.8 AI 模型选择合适的 GGUF 量化变体以在 32 GB 显存下获得良好性能的挑战,寻求社区推荐。
大家都很清楚 qwen 3.8 不是玩具。但对于像我这样偶尔参与的人来说,我搞不清楚到底该尝试什么才能达到期待的性能。我读到 q4_k_m 变体效果不会好。我想知道哪个才真正值得尝试。我有 32 GB 显存。
相似文章
empero-ai/Qwen3.8-27B-Ridge-GGUF
本文介绍了Qwen3.8-27B AI模型的量化GGUF版本发布,该版本针对有限显存硬件上的高效本地推理进行了优化。
我们量化了 Qwen 3.8 27B 并在 RTX 6000 上比较了量化版本
团队将 Qwen 3.8 27B 量化为多种 GGUF 格式,并在 RTX 6000 上进行了基准测试,发现不同量化版本性能相似,推荐 AD-Q6_K 以保证安全性。
更新:适用于ik_llama.cpp的Qwen-27B-IQ4_KS和Qwen-27B-IQ_KS_KT量化版本,尤其针对16GB显存的NVIDIA显卡
面向16GB显存NVIDIA GPU优化的新型Qwen3.6-27B GGUF量化版本,包含实验性Trellis变体,并附带了困惑度基准测试。
@WaleedAhmad1a10: 查看 Qwen 3.5 27B MoQ 的 GGUF 文件:
Hugging Face 仓库 (kaitchup/Qwen3.6-27B-GGUF-MoQ) 提供了 Qwen3.6-27B MoQ 模型的 GGUF 量化权重,支持使用 llama.cpp 和 Ollama 等工具进行本地推理。
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
该仓库提供了使用GSQ和RCO方法对Qwen3.8-27B AI模型进行GGUF量化的版本,以便在标准工具中高效部署。