@9hills: Qwen3.8-27B 本地部署指南 1. Q4 基本没有质量损失,甚至可以用Q3 2. 用Unsloth的GGUF。 3. 思考开low就行了。 4. 开 dflash2
摘要
本文提供了 Qwen3.8-27B 模型的本地部署指南,推荐使用 Q4 量化和 Unsloth GGUF 工具,并分享了与 FP8 基准相比较的性能测试结果。
查看缓存全文
缓存时间: 2026/08/22 01:19
Qwen3.8-27B 本地部署指南
- Q4 基本没有质量损失,甚至可以用Q3
- 用Unsloth的GGUF。
- 思考开low就行了。
- 开 dflash2
Alexey Fateev (@superalesha): Main result. At xhigh every quant landed between 88.0 and 90.0% pass@1 on the full suite:
AWQ INT4: 90.0% NVFP4: 89.3% GGUF Q4_K_M: 89.3% FP8: 88.7% NInfer: 88.0%
Yes, the 4 bit quants scored above the FP8 baseline. McNemar says its a statistical tie, first and last place
相似文章
@wherecall1: 3060 12G 跑 Qwen3.8-27B-Unleashed(无审查)安装踩坑记录,每个坑都标了解法,照着做即可复现。 ① 选版本 仓库:outsourc-e/Qwen3.8-27B-Unleashed-GGUF,9 个量化档。306…
本文提供了在3060 12G显卡上运行Qwen3.8-27B-Unleashed模型的详细安装指南,涵盖版本选择、下载问题和启动配置,并总结了常见错误的解决方法。
@WaleedAhmad1a10: 查看 Qwen 3.5 27B MoQ 的 GGUF 文件:
Hugging Face 仓库 (kaitchup/Qwen3.6-27B-GGUF-MoQ) 提供了 Qwen3.6-27B MoQ 模型的 GGUF 量化权重,支持使用 llama.cpp 和 Ollama 等工具进行本地推理。
unsloth/Qwen3.6-27B-MTP-GGUF
Unsloth 发布了 Qwen3.6-27B 模型的 GGUF 权重,该模型支持多令牌预测(MTP),可实现更快的生成速度并增强了智能体(Agentic)编码能力。
@shangdu2005: 比上个版本更加无敌的。 Qwen3.8 27B越狱无审查版本。 这两个自行测试,谨慎使用。 1.orcarouter https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8…
本文介绍了一个未审查的Qwen3.8 27B AI模型,该模型经过修改以移除安全限制,并量化为FP8以提高效率,适用于研究目的。
@TeksEdge: Unsloth 发布了目前我测试过的最快的 Qwen3.6-27B MTP GGUF。是时候升级了。与之前的 GGUF 相比,Q4/Q6 XL 版本的推理速度快了约 55%…
Unsloth 发布了优化后的 Qwen3.6-27B MTP 模型 GGUF 版本,与前序量化版本相比,推理速度显著提升(在 RTX 5090 上最高可达 114 tok/s)。