Tequila:一种面向大语言模型的无陷阱三元量化方法

Papers with Code Trending 论文

摘要

本文介绍了Tequila,这是一种针对大语言模型的无陷阱量化方法,通过将陷入死区的权重重新利用为动态偏置,提高了三元量化的准确性和推理速度。

量化技术对于在边缘设备上部署大语言模型(LLMs)至关重要。然而,现有方法通常依赖于缺乏高效硬件支持的混合精度乘法,导致其实用性受限。三元权重量化通过将权重限制在{-1, 0, 1},用硬件高效的加法替代昂贵的乘法运算,从而解决了这一问题。然而,这种激进的压缩即使在经过大量数据的高代价量化感知训练后,仍会导致显著的准确性下降。我们将核心问题确定为“死区陷阱”:大量权重被困在死区边界。这是因为这些权重仅接收到嘈杂且信息量不足的梯度,阻碍了其稳定脱离死区,严重削弱了模型容量和优化能力。 为解决这一问题,我们提出了Tequila,一种无陷阱量化优化方法,通过将陷入死区的权重重新利用为动态偏置来重新激活它们。这使得被重新利用的权重在前向传播中能够提供连续的信号,更重要的是,在反向传播期间接收直接且有意义的梯度信号,从而在几乎零推理开销的情况下增强模型容量和优化效果。广泛评估表明,Tequila在五个基准测试中均优于最先进的(SOTA)三元量化方法。具体而言,在ARC基准测试中,它比SOTA基线提高了>4%的准确性,几乎达到了全精度性能(差距<1%),并实现了3.0倍的推理速度提升。因此,Tequila为在资源受限环境中部署先进LLMs提供了一个高度实用和高效的实现方案。代码可用地址:https://github.com/Tencent/AngelSlim。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:55

论文页面 - Tequila:用于大语言模型的无陷阱三值量化

来源:https://huggingface.co/papers/2509.23809 发布日期:2025年9月28日

摘要

Tequila 是一种无陷阱量化方法,通过将死区被困权重重新利用为动态偏差,提升了大语言模型的三值量化效果,从而提高了准确性和推理速度。

量化技术(https://huggingface.co/papers?q=Quantization%20techniques)对于在边缘设备上部署大语言模型(LLMs)至关重要。然而,现有方法通常依赖于缺乏高效硬件支持的混合精度乘法(https://huggingface.co/papers?q=mixed-precision%20multiplication),这使其难以实际应用。三值权重量化(https://huggingface.co/papers?q=Ternary%20weight%20quantization)通过将权重限制为 {-1, 0, 1},用硬件高效的加法替代昂贵的乘法操作,从而解决了这一问题。然而,这种激进的压缩会导致显著的精度下降,即使在使用海量数据进行昂贵的量化感知训练(https://huggingface.co/papers?q=quantization-aware%20training)之后也是如此。我们将核心问题确定为死区陷阱(https://huggingface.co/papers?q=deadzone%20trapping):大量权重被困在死区边界。这是因为这些权重仅接收到嘈杂且无信息量的梯度,无法稳定地逃离死区,从而严重阻碍了模型容量和优化。为了解决这一问题,我们提出了 Tequila,这是一种无陷阱量化优化方法,通过将死区被困权重重新利用为动态偏差(https://huggingface.co/papers?q=dynamic%20biases)来重新激活它们。这使得重新利用的权重能够在前向传播中提供连续信号,并且最关键的是,在反向传播(https://huggingface.co/papers?q=backpropagation)期间接收直接且有意义的梯度信号,从而在几乎零推理开销(https://huggingface.co/papers?q=inference%20overhead)的情况下增强模型容量和优化。大量评估表明,Tequila 在五个基准测试中均优于最先进的(SOTA)三值量化方法。具体而言,在 ARC 基准测试中,它比 SOTA 基线高出 >4% 的准确率,几乎匹配全精度性能(https://huggingface.co/papers?q=full-precision%20performance)(差距 <1%),同时实现了 3.0 倍的推理加速。因此,Tequila 为在资源受限环境中部署先进的 LLMs 提供了一种高度实用且高效的实现方案。代码可在 https://github.com/Tencent/AngelSlim 获取。

查看 arXiv 页面(https://arxiv.org/abs/2509.23809)查看 PDF(https://arxiv.org/pdf/2509.23809)GitHub 1.03k auto(https://github.com/Tencent/AngelSlim)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2509.23809)

在您的代理中获取此论文:

hf papers read 2509\.23809

没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 31

AngelSlim/Qwen3-a3B_eagle3 (https://huggingface.co/AngelSlim/Qwen3-a3B_eagle3)

AngelSlim/Qwen3-32B_eagle3 更新于 1月13日 • 2.19k • 7 (https://huggingface.co/AngelSlim/Qwen3-32B_eagle3)

AngelSlim/Qwen3-1.7B_eagle3 更新于 1月13日 • 44.5k • 5 (https://huggingface.co/AngelSlim/Qwen3-1.7B_eagle3)

AngelSlim/Fun-CosyVoice3-0.5B-2512_eagle3 24.4M • 更新于 1月13日 • 10 • 5 (https://huggingface.co/AngelSlim/Fun-CosyVoice3-0.5B-2512_eagle3)

浏览引用此论文的 31 个模型 (https://huggingface.co/models?other=arxiv:2509.23809)

引用此论文的数据集 0

没有链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2509.23809 以从此页面链接。

引用此论文的空间 0

没有链接到此论文的空间

在空间 README.md 中引用 arxiv.org/abs/2509.23809 以从此页面链接。

包含此论文的合集 1

相似文章

CAT-Q: 用于LLM的高效且准确的三值量化

arXiv cs.CL

CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。

基于平坦度的理论最优量化

arXiv cs.LG

介绍了平坦度度量与双向对角量化(BDQ)用于大型语言模型的训练后量化,实现了接近无损的4比特权重和激活量化,并在极低比特设置下取得了显著改进。