Tequila:一种面向大语言模型的无陷阱三元量化方法
摘要
本文介绍了Tequila,这是一种针对大语言模型的无陷阱量化方法,通过将陷入死区的权重重新利用为动态偏置,提高了三元量化的准确性和推理速度。
查看缓存全文
缓存时间: 2026/05/08 08:55
论文页面 - Tequila:用于大语言模型的无陷阱三值量化
来源:https://huggingface.co/papers/2509.23809 发布日期:2025年9月28日
摘要
Tequila 是一种无陷阱量化方法,通过将死区被困权重重新利用为动态偏差,提升了大语言模型的三值量化效果,从而提高了准确性和推理速度。
量化技术(https://huggingface.co/papers?q=Quantization%20techniques)对于在边缘设备上部署大语言模型(LLMs)至关重要。然而,现有方法通常依赖于缺乏高效硬件支持的混合精度乘法(https://huggingface.co/papers?q=mixed-precision%20multiplication),这使其难以实际应用。三值权重量化(https://huggingface.co/papers?q=Ternary%20weight%20quantization)通过将权重限制为 {-1, 0, 1},用硬件高效的加法替代昂贵的乘法操作,从而解决了这一问题。然而,这种激进的压缩会导致显著的精度下降,即使在使用海量数据进行昂贵的量化感知训练(https://huggingface.co/papers?q=quantization-aware%20training)之后也是如此。我们将核心问题确定为死区陷阱(https://huggingface.co/papers?q=deadzone%20trapping):大量权重被困在死区边界。这是因为这些权重仅接收到嘈杂且无信息量的梯度,无法稳定地逃离死区,从而严重阻碍了模型容量和优化。为了解决这一问题,我们提出了 Tequila,这是一种无陷阱量化优化方法,通过将死区被困权重重新利用为动态偏差(https://huggingface.co/papers?q=dynamic%20biases)来重新激活它们。这使得重新利用的权重能够在前向传播中提供连续信号,并且最关键的是,在反向传播(https://huggingface.co/papers?q=backpropagation)期间接收直接且有意义的梯度信号,从而在几乎零推理开销(https://huggingface.co/papers?q=inference%20overhead)的情况下增强模型容量和优化。大量评估表明,Tequila 在五个基准测试中均优于最先进的(SOTA)三值量化方法。具体而言,在 ARC 基准测试中,它比 SOTA 基线高出 >4% 的准确率,几乎匹配全精度性能(https://huggingface.co/papers?q=full-precision%20performance)(差距 <1%),同时实现了 3.0 倍的推理加速。因此,Tequila 为在资源受限环境中部署先进的 LLMs 提供了一种高度实用且高效的实现方案。代码可在 https://github.com/Tencent/AngelSlim 获取。
查看 arXiv 页面(https://arxiv.org/abs/2509.23809)查看 PDF(https://arxiv.org/pdf/2509.23809)GitHub 1.03k auto(https://github.com/Tencent/AngelSlim)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2509.23809)
在您的代理中获取此论文:
hf papers read 2509\.23809
没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 31
AngelSlim/Qwen3-a3B_eagle3 (https://huggingface.co/AngelSlim/Qwen3-a3B_eagle3)
AngelSlim/Qwen3-32B_eagle3 更新于 1月13日 • 2.19k • 7 (https://huggingface.co/AngelSlim/Qwen3-32B_eagle3)
AngelSlim/Qwen3-1.7B_eagle3 更新于 1月13日 • 44.5k • 5 (https://huggingface.co/AngelSlim/Qwen3-1.7B_eagle3)
AngelSlim/Fun-CosyVoice3-0.5B-2512_eagle3 24.4M • 更新于 1月13日 • 10 • 5 (https://huggingface.co/AngelSlim/Fun-CosyVoice3-0.5B-2512_eagle3)
浏览引用此论文的 31 个模型 (https://huggingface.co/models?other=arxiv:2509.23809)
引用此论文的数据集 0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2509.23809 以从此页面链接。
引用此论文的空间 0
没有链接到此论文的空间
在空间 README.md 中引用 arxiv.org/abs/2509.23809 以从此页面链接。
包含此论文的合集 1
相似文章
[论文] 大语言模型的统计无损量化
本文提出了一种针对大语言模型的统计无损量化方法,旨在在不损失信息的情况下减小模型大小。
CAT-Q: 用于LLM的高效且准确的三值量化
CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。
基于平坦度的理论最优量化
介绍了平坦度度量与双向对角量化(BDQ)用于大型语言模型的训练后量化,实现了接近无损的4比特权重和激活量化,并在极低比特设置下取得了显著改进。
ExTernD: 扩展秩三值分解——精度逼近任意量化水平的LLM训练后量化
ExTernD引入了一种扩展秩三值分解用于LLM训练后量化,通过使用具有自由内秩的因子化表示,使精度接近bf16。在Gemma-4和Qwen3.5等模型上,它以每个权重5.2-5.5有效比特达到Q4_K的精度。
Qift: 移位友好的无零点W2训练后量化,用于旋转W2A4/KV4大语言模型推理
本文介绍了Qift,一种固定的无零点两位权重量化层级集,专为Hadamard旋转的大语言模型设计,通过利用旋转权重的近零中心高斯类分布,实现了改进的W2A4/KV4推理。在LLaMA-2-7B和LLaMA-3.1-8B上的实验显示,相比于标准W2量化,困惑度持续提升。