语言条件反量化:恢复量化从非英语语言中抹去的内容
摘要
本文介绍了语言条件反量化(LCD),一种事后方法,向已量化的LLM添加每种语言的低秩LoRA修正,以恢复因英语校准量化而丢失的多语言性能,并在非英语语言上显示出显著的困惑度和准确率提升。
arXiv:2608.11786v1 公告类型:新论文
摘要:激进量化对多语言能力造成了不成比例的损害:在低于4B参数的INT3 GPTQ设置中,我们测得的非英语语言困惑度退化是英语的2-4倍。我们提出语言条件反量化(LCD),一种事后方法,为已量化模型的线性层附加每种语言的秩-2 LoRA修正,每种语言仅增加0.12%的参数,并在单个GPU上训练不到20分钟。在Qwen2.5-3B和Llama-3.2-3B上,LCD恢复了非拉丁文字语言困惑度差距的70-83%,以及GlobalMMLU准确率差距的17-28%,在类型学上遥远的语言上比同等能力的语言无关修正高出3-9个百分点,比无数据低秩基线(LQER)高出一个数量级。我们进一步发现了困惑度与准确率之间的脱节,并将其追溯到量化集中造成损伤的位置:早期深度错误(Llama)会向下游传播并抵抗局部修正,而晚期深度错误(Qwen)则不会。LCD的层限制变体直接验证了这一机制。
查看缓存全文
缓存时间: 2026/08/13 15:28
# 语言条件反量化:恢复量化从非英语语言中窃取的能力
###### 摘要
激进的量化对多语言能力的影响不成比例:在 sub-4B INT3 GPTQ 机制下,我们测量到非英语语言的困惑度退化比英语大 2–4 倍。我们提出语言条件反量化(LCD),一种事后方法,将每种语言的秩为 2 的 LoRA 修正附加到已量化模型的线性层上,每语言仅增加 0.12% 的参数,并在单个 GPU 上训练不到 20 分钟。在 Qwen2.5-3B 和 Llama-3.2-3B 上,LCD 恢复了非拉丁文字语言 70–83% 的困惑度差距以及 GlobalMMLU 准确率差距的 17–28%,在类型学上距离较远的语言上比同容量的语言无关修正高出 3–9 个百分点,比无数据低秩基线(LQER)高出一个数量级。我们进一步发现了一个*困惑度–准确率脱节*现象,并将其追溯到量化损害集中的*位置*:早期深度错误(Llama)会向后传播并抵抗局部修正,而晚期深度错误(Qwen)则不会。LCD 的一种层受限变体直接验证了这一机制。
## 1 引言
量化大语言模型每天为全球各种语言服务数十亿次查询。当韩国用户查询一个 3 位量化模型时,他们获得的输出在可测量的程度上比英语用户差,这并不是因为原始模型缺乏韩语能力,而是因为量化过程完全是在英语数据上校准的。在本文中,我们在量化最需要的场景下量化了这一差距的严重性:在 Qwen2.5-3B 上,INT3 GPTQ 使阿拉伯语的困惑度退化了 4.37 倍,日语退化了 3.04 倍,而英语仅为 1.35 倍;在 Llama-3.2-3B 上,这一模式重复出现(阿拉伯语 3.65 倍,英语 1.39 倍)。在 sub-4B INT3 机制下,这是一个实际影响重大的、与语言相关的质量差距。
多语言校准[2](https://arxiv.org/html/2608.11786#bib.bib2)从根源上解决了问题,但需要重新量化,这对已部署的模型来说不切实际。静态误差修正方法(LQER[16](https://arxiv.org/html/2608.11786#bib.bib5)、RILQ[9](https://arxiv.org/html/2608.11786#bib.bib6)、ResQ[13](https://arxiv.org/html/2608.11786#bib.bib7))事后添加低秩残差,但无论输入语言是什么都应用相同的修正。输入条件方法如 BinaryMoS[8](https://arxiv.org/html/2608.11786#bib.bib4)适应输入调整权重,但针对二值化,且忽略了语言身份。
我们提出语言条件反量化(LCD),基于一个简单的洞见:*如果量化误差与语言相关,那么修正也应该是与语言相关的*。对于量化模型中的每个线性层,LCD 通过前向钩子附加每种语言的秩为 r 的加性修正:
\[
\hat{y}=W_q x + \frac{1}{r}(A_\ell \cdot B_\ell) \cdot x
\tag{1}
\]
其中 \(A_\ell \in \mathbb{R}^{d_{\text{out}} \times r}\) 和 \(B_\ell相似文章
Recover-LoRA用于激进量化:通过合成数据上的知识蒸馏低秩适配恢复2比特语言模型精度
AMD的研究人员提出了Recover-LoRA,该方法利用基于合成数据的知识蒸馏低秩适配,恢复因LLM激进2比特量化而损失的精度。在Qwen3-4B模型上仅使用1万个合成样本,就在12个基准测试中的9个上实现了80%–95%的精度恢复。
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
激活离群值重要性:量化多模态LLMs的鲁棒恢复
本文将激活量化识别为超低比特量化多模态LLMs中的主要瓶颈,并提出残差回退量化(RFQ)以最小开销恢复性能。
面向大语言模型的显著性感知正则化量化校准
本文提出了显著性感知正则化量化校准(SARQC),这是一个统一的框架,通过添加正则化项以保持权重接近度,从而改善大语言模型(LLM)的训练后量化(PTQ),提升泛化能力和性能。
量化感知修复:恢复压缩4位大语言模型的实用方法
量化感知修复是一种通过直接从原始未压缩模型蒸馏来恢复压缩4位语言模型的方法,提供比量化感知训练更快、更稳定的性能。