Qwen 3.8 27B 在 RTX 3060 上使用约 3 BPW:GSQ 与 ByteShape IQ3-XXS 2.88BPW 的比较

Reddit r/LocalLLaMA 新闻

摘要

本文比较了在 RTX 3060 上对 Qwen 3.8 27B 模型进行 GSQ 和 ByteShape 量化的结果,揭示了尽管 ByteShape 量化声称与原始模型高度相似,但其性能却表现不佳。

有人在看到我之前对 GSQ 量化的测试后,推荐我尝试 ByteShape Qwen 3.8 27B IQ3-XXS GGUF。于是我试了试。结果却……出乎意料地糟糕。背景信息:我的配置是 RTX 3060 12GB、16GB DDR4 内存(单通道)、CachyOS / Arch Linux、llama.cpp、Qwen 3.8 27B,在适用的情况下启用 MTP/推测解码。我比较的两个低比特量化版本是:ISTA-DASLab / GSQ-RCO-IQ3-XXS,约 10.4GB,大约在 2.5 BPW 范围,启用 MTP,约 29 令牌/秒 在完整上下文下,约 34–40 令牌/秒 在较低上下文中。这就是我之前在网页开发测试中使用的量化版本。ByteShape IQ3-XXS 大约小 500MB,同样处于相同的超低比特范围,基于 KL 散度测量,声称与 BF16 模型具有极高的相似度。理论上,ByteShape 量化版看起来非常有趣。它体积更小,同时明显保留了与原始 BF16 模型极高的相似度。而且它在大小上也与显著更高 BPW 的量化版本相比较。因此,我自然期望它至少能与 GSQ 版本相竞争。但事实并非如此。实际结果如上所示。ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF 能够在一次尝试中生成一个 3D 体素场景,使用少于 55k 令牌,而 Byteshape 的 3.8 27B 模型需要大约三次尝试,且已花费超过 98K 令牌仍未完成。网页开发方面同样不如同广告所述,这里有一些针对 RTX 3060 的新模型建议吗?
查看原文

相似文章

Shapelearn Qwen 3.8 27B(13.1 GB 显存)

Hacker News Top

ByteShape 发布了完整的 ShapeLearn 量化版 Qwen 3.8 27B 模型,采用 GGUF 格式,基准测试显示质量-速度前沿有所改进,并支持投机解码。

Qwen 3.6 35B GGUF:跨GPU和CPU的NTP vs MTP量化结果

Reddit r/LocalLLaMA

ByteShape发布了Qwen 3.6 35B GGUF的NTP和MTP变体量化,并在多个GPU和CPU上进行了详细基准测试,发现更大的量化模型通常优于较小的模型,MTP以内存为代价提供了GPU速度提升。