我的Qwen3.8-27B任务感知量化在15%的体积下达到了BF16推理性能的99%。

Reddit r/LocalLLaMA 工具

摘要

一种名为TAK的新任务感知量化方法,在显著减小模型尺寸的情况下,实现了接近BF16的推理性能,在多种AI模型上超越了Unsloth。

简而言之,我的TAK量化版本Qwen 3.8 27b在推理任务中得分82.81%,相比之下,字节匹配的Unsloth UD IQ2_S得分为77.34%,BF16得分为83.59%。在过去几个月里,我一直在探索任务感知量化。我现在将这项工作整理成了一个干净、可重复的流水线,专注于推理领域。编码是我的下一个目标。有一段时间,我使用了Qlab,这是一个更广泛、更注重测量的系统,帮助我确定测试什么以及在哪里调查。它对于探索很棒,但积累了很多门控和操作开销。一旦我找到了可靠的流水线,我就专门化了它,并退役了旧的应用程序。新系统称为TAK:Task Aware Knapsack。我既将TAK用作应用程序,也用作它产生的模型。从高层次看,TAK是TASA和TAQ的混合体。它从一个任务特定语料库构建的imatrix开始。然后我们找到模型悬崖,在崩溃前的最小尺寸。然后将这些测量值与张量级分配结合,在字节特定预算内提升和降级张量。结果是专门构建的量化,而不是通用恢复。Unsloth作为行业标准参考被包含在内。并不是声称方法等价。没有剪枝、微调、模型合并或其他任何东西。这纯粹是一个Imatrix + 损害分配过程。这些都在一个保留的数据集上进行测试。以下是我当前的获胜者:https://huggingface.co/ByteOtter Qwen3.8-27B: 82.81% vs 77.34% Unsloth, +5.47 points Qwen3.5-4B: 73.44% vs 61.72% Unsloth, , +11.72 points Gemma 4 E4B: 69.53% vs 55.47% Unsloth, , +14.06 points Gemma 3 4B QAT: 54.69% vs 35.16% Unsloth, , +19.53 points 在这些运行中,TAK在目标推理基准上击败了匹配的Unsloth Dynamic 1.0、2.0和现在3.0的比较器。该方法在Gemma 3、Gemma 4、Qwen3.5和Qwen3.8上均有效,覆盖了密集、QAT和MoE架构。综合这些结果,给我提供了强有力的证据,表明任务感知精度分配对推理非常有效。我兴奋地将流水线扩展到编码和数学等其他领域。图表由ChatGPT根据我的数据提供。您可以在X上关注工作u/byteotter https://x.com/byteotter 或支持Buy Me a Coffee。https://buymeacoffee.com/byteotter
查看原文

相似文章

Qwen/Qwen3.6-27B-FP8

Hugging Face Models Trending

阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。