GPTQ-2D:三次时间复杂度的双边自适应舍入
摘要
本文介绍了GPTQ-2D,一种双边自适应舍入方法,其产生的结果与在向量化矩阵上应用GPTQ相同,但运行时间复杂度从四次方降为三次方。
查看缓存全文
缓存时间: 2026/08/04 09:38
论文页面 - GPTQ-2D:三次时间复杂度的双侧自适应舍入
来源:https://huggingface.co/papers/2607.27042
摘要
诸如GPTQ之类的自适应舍入方法,等价于Babai最近平面算法,在二次度量下将实数矩阵舍入为整数。它们按照固定顺序逐项处理矩阵元素,并通过三角反馈矩阵将每次舍入误差传播到尚未处理的元素。我们研究该任务的双侧版本,其中固定的非奇异基矩阵同时作用于残差的左侧和右侧;常见的单侧情形是右基为单位矩阵的特例。将矩阵向量化后,双侧目标函数转化为二次度量,其Gram矩阵为Kronecker积,因此一维算法可直接套用,但时间复杂度为矩阵维度的四次方。我们提出GPTQ-2D,能够在三次时间内产生完全相同的舍入矩阵。它按反对角线逐条舍入元素;同一反对角线上的元素相互独立,可并行处理。
查看arXiv页面 (https://arxiv.org/abs/2607.27042)查看PDF (https://arxiv.org/pdf/2607.27042)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27042)
引用此论文的模型0
暂无模型关联此论文
在模型README.md中引用arxiv.org/abs/2607.27042,即可从此页面链接到该模型。
引用此论文的数据集0
暂无数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2607.27042,即可从此页面链接到该数据集。
引用此论文的Space0
暂无Space关联此论文
在Space的README.md中引用arxiv.org/abs/2607.27042,即可从此页面链接到该Space。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从此页面链接到该收藏集。
相似文章
内积感知量化:可证明快速、准确且自适应的算法
本文介绍了内积感知量化方法,这些方法能够保留与未见向量的内积,开发了具有可证明保证的快速自适应算法,相较于先前的ASQ方法实现了2-10倍的加速。
我尝试了三元分解而不是量化。它的效果与q4km一样好,但占用稍多的VRAM。同时完全是三元,且完全是PTQ(无QAT)
作者声称,三元分解的性能与Q4_K_M量化一样好,同时使用稍多的VRAM,并且完全是三元和PTQ,无需QAT。
ExTernD: 扩展秩三值分解——精度逼近任意量化水平的LLM训练后量化
ExTernD引入了一种扩展秩三值分解用于LLM训练后量化,通过使用具有自由内秩的因子化表示,使精度接近bf16。在Gemma-4和Qwen3.5等模型上,它以每个权重5.2-5.5有效比特达到Q4_K的精度。
EverydayGPT:面向高效安全混合GPT-RAG对话问答的置信门控路由
EverydayGPT 引入置信门控路由(CGR)机制,该机制针对每个查询决定使用RAG、直接GPT生成还是拒绝,在85%的查询上实现120倍延迟降低,同时保持答案质量,这在500问题基准测试中得到验证。
Q-Interference:内存高效的相位感知量子启发注意力机制
本文提出Q-Interference,一种用于GPT模型的内存高效量子启发注意力机制,该机制使用相位感知评分和精确三角因式分解,以改善令牌交互而不增加内存开销。