Qwen 3.5 4B IQ2_XS:通过张量级分配提升16.67%推理性能
摘要
ByteOtter在Qwen 3.5 4B上复现了张量级分配,实现了16.67%的相对推理性能提升,同时模型大小仅增加0.412%,标志着这是Gemma之外的首次跨家族应用。
我终于能够在Gemma家族之外复现张量级分配。https://huggingface.co/ByteOtter/Qwen3.5-4B-CADA-IQ2_XS 在Gemma 4 12b、e4b和gemma 3 4b的结果之后,我尝试扩展到Qwen,但遇到了一些障碍。经过2次版本更新和略有不同的方法,我成功在Qwen上复现了该效果。结果:BF16推理:78.125 原版IQ2_XS + imatrix:46.875 QLAB分配 + 相同imatrix:54.688 这意味着提高了7.812个百分点,即相对于原版imatrix量化,推理性能提升了16.67%。模型大小:原版:1,630,594,336字节 QLAB:1,637,318,816字节 差异:+0.412% 与之前运行的思路相同。从基于类别的语料库构建imatrix,衡量损害,然后在保持相同字节预算的情况下在张量级重新分配精度。这次,最佳目标落在iq2_xs上,且改进不仅限于推理。这是一个类别针对性的量化实验,而非通用模型改进。重点是分配机制的成功转移。我现已观察到在密集、moe、qat、非qat、gemma以及现在的qwen上成功分配。这里没有进行后训练、lora、剪枝或权重更新。这完全通过改变量化预算内的精度分配来实现。此外,我已开始在此处发布进展:https://x.com/byteotter 我接下来将运行Qwen 1.5 a2 7b。之后,我想尝试更大的模型。不幸的是,每次尝试需要1-3次,以及数小时的计算和存储,成本较高。如果有人想帮助资助该次运行的计算,我在这里:https://buymeacoffee.com/byteotter 我估计qwen 3.8 27b在租用的Digital Ocean GPU droplet上每次运行需140美元,可能需要几次尝试。最终目标仍然是:给qlab一个全精度gguf,选择你想要的功能,让它在悬崖处自动调整,并应用损害恢复张量分配,以在目标字节预算内尽可能保留这些功能。图表由chatgpt根据我的数据构建。总结:在Qwen 3.5 4B IQ2_XS上,张量级分配将保留的推理性能从46.875提高到54.688,相对于原版imatrix量化,提高了7.812点/16.67%的相对增益,仅增加0.412%的字节。十一个评估套件中有八个改进,但在知识QA、结构化输出和连贯性方面有所退步。最重要的是,这是QLAB在Gemma之外的首次跨家族复现。
相似文章
不流行观点:Qwen 3.8 27b 不是过度思考者
文章认为,Qwen 3.8 27b 增加的推理令牌使用量与其他中国AI模型如 GLM 和 DeepSeek 相似,用户的挫败感源于硬件限制。它建议使用推理预算可以保持性能优于 Qwen 3.6。
我的Qwen3.8-27B任务感知量化在15%的体积下达到了BF16推理性能的99%。
一种名为TAK的新任务感知量化方法,在显著减小模型尺寸的情况下,实现了接近BF16的推理性能,在多种AI模型上超越了Unsloth。
Qwen 3.8 27B Aider 得分
用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。
我在 RTX 5090 上用同一真实架构写作任务实测 Qwen3.6-27B、Qwen3.6-35B-A3B、Qwen3.5-27B 与 Gemma 4
在 RTX 5090 上,让四款本地大模型——Qwen3.6-27B、Qwen3.6-35B、Qwen3.5-27B 与 Gemma 4——完成 2 万 token 架构写作任务,结果显示 Qwen3.6-27B 在清晰度、完整性与实用性上取得最佳综合平衡。
Qwen 3.6 27B 在 DeepSWE 上的表现
Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。