我的Qwen3.8-27B任务感知量化在15%的体积下达到了BF16推理性能的99%。
摘要
一种名为TAK的新任务感知量化方法,在显著减小模型尺寸的情况下,实现了接近BF16的推理性能,在多种AI模型上超越了Unsloth。
简而言之,我的TAK量化版本Qwen 3.8 27b在推理任务中得分82.81%,相比之下,字节匹配的Unsloth UD IQ2_S得分为77.34%,BF16得分为83.59%。在过去几个月里,我一直在探索任务感知量化。我现在将这项工作整理成了一个干净、可重复的流水线,专注于推理领域。编码是我的下一个目标。有一段时间,我使用了Qlab,这是一个更广泛、更注重测量的系统,帮助我确定测试什么以及在哪里调查。它对于探索很棒,但积累了很多门控和操作开销。一旦我找到了可靠的流水线,我就专门化了它,并退役了旧的应用程序。新系统称为TAK:Task Aware Knapsack。我既将TAK用作应用程序,也用作它产生的模型。从高层次看,TAK是TASA和TAQ的混合体。它从一个任务特定语料库构建的imatrix开始。然后我们找到模型悬崖,在崩溃前的最小尺寸。然后将这些测量值与张量级分配结合,在字节特定预算内提升和降级张量。结果是专门构建的量化,而不是通用恢复。Unsloth作为行业标准参考被包含在内。并不是声称方法等价。没有剪枝、微调、模型合并或其他任何东西。这纯粹是一个Imatrix + 损害分配过程。这些都在一个保留的数据集上进行测试。以下是我当前的获胜者:https://huggingface.co/ByteOtter Qwen3.8-27B: 82.81% vs 77.34% Unsloth, +5.47 points Qwen3.5-4B: 73.44% vs 61.72% Unsloth, , +11.72 points Gemma 4 E4B: 69.53% vs 55.47% Unsloth, , +14.06 points Gemma 3 4B QAT: 54.69% vs 35.16% Unsloth, , +19.53 points 在这些运行中,TAK在目标推理基准上击败了匹配的Unsloth Dynamic 1.0、2.0和现在3.0的比较器。该方法在Gemma 3、Gemma 4、Qwen3.5和Qwen3.8上均有效,覆盖了密集、QAT和MoE架构。综合这些结果,给我提供了强有力的证据,表明任务感知精度分配对推理非常有效。我兴奋地将流水线扩展到编码和数学等其他领域。图表由ChatGPT根据我的数据提供。您可以在X上关注工作u/byteotter https://x.com/byteotter 或支持Buy Me a Coffee。https://buymeacoffee.com/byteotter
相似文章
@danielhanchen: 我们还发布了可在8GB内存上运行的1位 Qwen3.8-27B 量化版本。它们相比BF16保留了约77%的准确率。我们原本…
Unsloth AI 发布了可在8GB内存上运行的 Qwen3.8-27B AI模型的1位量化版本,相比BF16精度保留了约77%的准确率。
Qwen 3.5 4B IQ2_XS:通过张量级分配提升16.67%推理性能
ByteOtter在Qwen 3.5 4B上复现了张量级分配,实现了16.67%的相对推理性能提升,同时模型大小仅增加0.412%,标志着这是Gemma之外的首次跨家族应用。
需要第二双眼睛,这个Qwen3.6 27B量化方案总是用更少的思考且正确
作者分享了一个Qwen3.6 27B的量化方案,该方案使模型使用显著更少的思考令牌,同时仍然产生正确的答案,从而在数学基准测试中实现更快的推理。
Qwen3.6-27B 推测解码在更大量化下性能提升
Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。
Qwen/Qwen3.6-27B-FP8
阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。