我构建了一个工具,在量化前实际测试哪些权重重要,而不是靠猜测(Qwen3.6-27B,三个版本:Bedrock/Tightrope/Gambit)

Reddit r/LocalLLaMA 模型

摘要

一位开发者构建了一个测试框架,在量化过程中测量每个权重组的 KL 散度,从而生成了 Qwen3.6-27B 的三个定制量化版本(Bedrock、Tightrope、Gambit),实现了优化的压缩。工具调用被确定为量化下最早退化的能力。

大多数量化的工作方式是这样的:选择一个位深,全局应用,可能让 imatrix 粗略猜测一下哪些重要,然后发布。大多数不会检查哪些特定的权重组可以承受压缩,哪些不能。这靠的是惯例和直觉。所以我构建了一个框架,每次量化一个权重组,并精确测量它与全精度模型的差异,使用 KL 散度在通用、代码、数学和工具调用提示上。不是猜测。每个权重组都有一个真实的数字。我想事先说明一点,以免别人指出:这种逐个权重组的测试,有经验的量化者已经非正式地在做,靠的是感觉和多年的迭代。我并不是在宣称发明了一项新技术。我只是将其自动化,并得到了真实数据,而不是靠直觉。我是一个人加一个测试框架,不是实验室,我也没宣称这比 bartowski、Unsloth 或 ik 的作品更好。他们的经验比我多得多。以下是测试结果:大小并不能预测一个权重组的压缩能力。我发现了大小和角色几乎相同但压缩容差截然不同的权重组。一个在激进设置下表现良好,它的架构孪生兄弟却在低两级时就崩溃了。只看模型是看不到这一点的。只有测试才能揭示。存在一个真正的悬崖,而且很窄。在我测试的所有内容中,可测量的差异始终集中在一个狭窄的区间内,大约每权重 3.5 到 3.9 比特。保持在这个区间以上,一切保持干净。低于这个区间,就开始出现裂痕。工具调用每次都是最先出问题的。在我测试的大多数权重组中,工具调用是第一个显示出差异的能力,领先于通用聊天、代码和数学。如果你关心量化模型中的智能体或工具使用性能,这是你需要关注的点,无论你运行的是谁的量化版本。利用所有这些构建了三个大小:Bedrock (13.26GB) —— 没有压缩超过测试证明安全的范围。最接近原始模型。Tightrope (12.53GB) —— 平衡版本。大多数权重组处于其安全点,少数几个在数据支持的条件下进一步压缩。Gambit (10.94GB) —— 激进版本。每个经过测试的权重组都有意地向前推进一步,超越其测量的安全点。最小的体积,在我所有测试中仍然表现良好:编码任务、逻辑谜题、多步推理。如果你 VRAM 紧张,这是最小的余地、最大的回报。我还为此构建了自己的 imatrix,而不是重复使用源模型自带的。这是手动、动手的测试,不是正式的基准测试套件。我不报告分数。但这也不是一个天真的扁平量化,所以通常应该比同大小的扁平量化表现更好。我把它发布出来,是因为我想要真实的反馈,而不仅仅是下载。如果你运行其中一个,我真的希望看到它的表现,截个图展示它做得好或搞砸的事情,两者对我都有用。如果有什么问题或感觉不对劲,请告诉我具体在哪里,这对我比任何赞美都更有价值。这是个人项目,我知道肯定有我还没发现的问题。请帮我找出来。链接:https://huggingface.co/enginetown/Qwen3.6-27B-Calibrated
查看原文

相似文章

Qwen3.6-27B 量化基准测试

Reddit r/LocalLLaMA

本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。