目前理论上的 LLM 量化最佳位宽是什么?[D]
摘要
一个讨论性问题,询问在固定内存预算下 LLM 量化的理论最佳位宽,并引用了 2025-2026 年关于 3-bit/2-bit 结果和缩放定律的研究。
我很好奇,现在是否存在 LLM 量化的理论或经验“最佳点”,最好是用 GGUF 等开源格式进行的研究。假设你有固定的内存/计算预算,可以自由选择模型大小。例如,与其使用 8-bit 或 4-bit 的较小模型,不如在 3-bit、2-bit、1.5-bit 等位宽下容纳一个逐渐变大的模型。几年前,我记得 4-bit 经常被描述为大致上的实际最佳点,因为它在大幅减少内存的同时保留了大部分模型质量。但随着更新的方法,我看到了令人惊讶的强 3-bit、2-bit,甚至约 1.5-bit 的结果。因此,如果目标是在固定内存预算下最大化模型能力,而不是尽可能忠实地保留某个特定的预训练模型,那么当前研究认为最优的 bits-per-weight 是多少?是否有证据表明,例如,2-bit 的 70B 模型通常优于 4-bit 的 35B 模型,还是量化退化最终会超过额外参数带来的收益?我尤其对 2025-2026 年最近的理论/缩放定律工作或大型实证研究感兴趣。如果没有人在研究这个,那么你们中有人能做这项工作吗?我觉得这对社区可能极其有用。
相似文章
ZK-LLM 之下的比特:面向可验证私有 LLM 推理的零知识友好型量化评估
本文首次对大语言模型的零知识友好型量化进行了系统性研究,对该概念进行了形式化定义,并在权重、激活值以及非线性查找表精度三个维度上评估了九个模型(包括 Qwen2.5-14B 和 Qwen3-30B-A3B)。研究发现,激活值精度和 RMSNorm 平方根倒数查找是 ZK 证明成本的主导因素,而传统的低比特量化启发式方法并不能转化为按比例的证明开销节省。
# LiftQuant:基于维度提升与投影的连续比特宽度大语言模型量化
# LiftQuant 引入"先提升后投影"机制,实现大语言模型的连续(非整数)位宽量化,精准适配硬件内存预算。该框架将 70B 大语言模型压缩至 2.4 位以适配 24GB GPU,性能超越当前最先进的 2 位模型。
压缩与遗忘:bitsandbytes量化放大LLMs中的前瞻干扰
论文发现,bitsandbytes INT4量化显著放大了LLMs中的前瞻干扰,在重复覆盖的上下文中降低了准确性,并突显了语义密集型应用中的部署风险。
LLM的GPU内存计算 (2026版)
一份实用指南,解释了如何根据参数量和量化级别计算LLM的VRAM需求,以及KV缓存、激活值和批处理带来的额外开销。
通过联合优化架构与量化策略实现 LLM 压缩
来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。