@outsource_: 全新 GLM+ Qwen 18B 可在消费级 GPU 上运行,仅用一半显存就打败 35B MoE
摘要
全新的 18B 融合量化模型 Qwopus-GLM-18B-GGUF,仅用一半显存即可在消费级 GPU 上运行,性能超越 35B MoE 模型。
查看缓存全文
缓存时间: 2026/04/21 10:32
全新 GLM+ Qwen 18B 可在消费级 GPU 上运行,仅用一半显存就能击败 35B MoE
@KyleHessling1 刚刚发布了修复版 Qwopus-GLM-18B-Merged-GGUF
疯狂 64 层“缝合怪”,融合两大顶尖 Qwen3.5-9B 微调(Opus 推理 + GLM-5.1 蒸馏)。
这玩意儿在消费级卡上直接起飞
相似文章
在老款GTX 1080(8GB显存,128k上下文)上,约30B的MoE模型达到24+ tok/s的推理速度
一位开发者展示了如何使用llama.cpp,通过MoE卸载和TurboQuant KV缓存量化技术,在老款GTX 1080(8GB显存)上以128k上下文运行Qwen 3.6 35B-A3B和Gemma 4 26B-A4B等MoE模型,达到24+ tok/s的推理速度,并揭示了针对Gemma MTP投机解码的优化技巧。
KyleHessling1/Qwopus-GLM-18B-Merged-GGUF
实验性 18B 参数模型:将两个 Qwen-3.5-9B 微调模型堆叠后,用 1000 步 QLoRA“缝合”层边界;生成的 GGUF 在 44 项测试集上超越 Qwen 3.6-35B MoE,却只占 9.2 GB 显存。
Jackrong/Qwopus-GLM-18B-Merged-GGUF
Jackrong 发布了 Qwopus-GLM-18B-Merged-GGUF,这是一个结合两个 Qwen3.5-9B 微调模型的 64 层“弗兰肯合并”模型,参数规模约 18B。通过 1000 步 LoRA 微调修复了层边界问题。该模型在能力基准测试中达到 90.9%,而显存消耗不到 Qwen 3.6-35B MoE 的一半。
@no_stp_on_snek: 这太厉害了!3090 级别的 GPU 欢呼吧!
Unsloth AI 发布了量化版 Qwen3.6 模型,在消费级 GPU 上运行速度快了 2.5 倍。其中 27B 模型可适配 24GB 显存,35B-A3B 模型实现了高吞吐量。
在AMD 6800H(iGPU/UMA)上测试Gemma 4和Qwen 3.6 MoE——性能解析
在AMD 6800H iGPU上使用llama.cpp Vulkan后端对Gemma 4和Qwen 3.6 MoE模型进行的基准测试表明,MoE模型和低位量化(Q4_0)提供了最佳性能,而Q8_0对于大型模型来说速度太慢。