ReRound:重建式舍入以解决无校准LLM量化中的中点模糊性
摘要
ReRound是一种训练后量化方法,使用条件扩散模型来引导接近中点的权重的舍入,在3位和4位量化下提高小型LLM的准确性,且不引入推理开销。
查看缓存全文
缓存时间: 2026/08/13 23:24
论文页面 - ReRound:重构式舍入以解决无校准 LLM 量化中的中点歧义
来源:https://huggingface.co/papers/2608.11045 发布于 8月11日
·
由 He-Yen Hsieh 于 8月13日 提交
摘要
ReRound 使用条件扩散模型在低比特训练后量化过程中指导接近中点的权重的舍入,通过匹配前导奇异值来选择候选,从而提高小型 LLM 的精度,且不引入推理开销。
ReRound(Reconstructive Rounding)是一种 训练后量化 方法,解决了标准 最近舍入(RTN)方案在量化靠近量化区间中心的权重时固有的中点歧义问题。ReRound 从预训练 LLM 出发,训练一个 条件扩散模型,为 LLM 生成低比特权重的连续重构。这些重构权重作为引导信号,消除位于区间中点附近的权重的舍入方向歧义。为了将这种重构引导的舍入与常规 RTN 集成,ReRound 引入了一种 容差度量,用于衡量量化权重(而非最终量化整数)离中点有多远:位于中点周围容差区域内的量化权重使用基于扩散的重构进行量化,而更接近量化边界的权重则使用 RTN 进行量化。通过扫描容差参数,ReRound 生成多个候选量化整数权重矩阵,并选择反量化后权重矩阵中 奇异值 与原始全精度权重最接近的候选。被选中的候选决定了 ReRound 使用的容差参数。ReRound 对较小的 LLM 特别有效。在一系列此类模型上,它在 3 位和 4 位权重量化方面始终优于标准 RTN。与大量无校准方法相比,ReRound 实现了更优的精度,与依赖校准的方法相比也保持竞争力,并且完全离线运行,在低比特推理期间不引入额外开销。ReRound 策略代表了 低比特量化 的一种新方法。该方法适用于 LLM 之外的 AI 模型。本文重点研究其在小型 LLM 上的应用。
查看 arXiv 页面查看 PDF项目页面GitHub1添加到收藏
在您的 agent 中获取此论文:
hf papers read 2608\.11045
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.11045,即可从本页面链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.11045,即可从本页面链接到它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.11045,即可从本页面链接到它。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏,即可从本页面链接到它。
相似文章
递归残差量化:一种面向大语言模型的渐进式多精度表示
提出了递归残差量化(RRQ),这是一种训练后量化框架,通过加法式残差细化,从单个LLM检查点获得多种有效精度,从而提高了灵活性和构建速度。
ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization
ReQuant introduces a backpropagation-free, fixed-grid discrete refinement stage for post-training quantization (PTQ) that iteratively improves initial quantized models while preserving the quantized format, showing consistent gains across various LLMs and bit-widths.
FAIR-Calib:面向扩散大语言模型训练后量化的前沿感知不稳定性重加权校准
本文提出了FAIR-Calib,一种用于扩散大语言模型的两阶段训练后量化框架,解决了迭代精炼过程中令牌提交的不稳定性问题。在低比特量化下,它在LLaDA和Dream模型上取得了最先进的结果。
REAL-Q:通过动态梯度下降实现端到端大语言模型量化
本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。
可训练的平滑旋转变换与学习到的通道缩放用于LLM量化
本文提出了可训练的平滑旋转变换,结合分位数鲁棒缩放和基于梯度的优化,以改进LLM的训练后量化,在LLaMA-3.2-1B的W4A4量化下实现了显著的误差降低。