ReRound:重建式舍入以解决无校准LLM量化中的中点模糊性

Hugging Face Daily Papers 论文

摘要

ReRound是一种训练后量化方法,使用条件扩散模型来引导接近中点的权重的舍入,在3位和4位量化下提高小型LLM的准确性,且不引入推理开销。

ReRound(重建式舍入)是一种训练后量化方法,用于解决标准最近舍入(RTN)方案在量化靠近量化区间中心的权重时固有的中点模糊性问题。 从预训练的LLM出发,ReRound训练一个条件扩散模型,为LLM生成低比特权重的连续重建。这些重建的权重作为引导信号,用于消除接近区间中点的权重的舍入方向歧义。 为了将这种重建引导的舍入与传统RTN集成,ReRound引入了一个容差度量,用于衡量量化权重(而非最终量化整数)距离中点有多远:位于中点周围容差区域内的量化权重使用基于扩散的重建进行量化,而更接近量化边界的权重则使用RTN量化。通过扫描容差参数,ReRound生成多个候选量化整数权重矩阵,并选择反量化后权重矩阵的前导奇异值与原始全精度权重最接近的候选。该选中的候选决定了ReRound使用的容差参数。 ReRound对较小的LLM尤其有效。在一系列此类模型中,它在3位和4位权重量化上始终优于标准RTN。与大量无校准方法相比,ReRound实现了更优越的准确性,同时与依赖校准的方法保持竞争力,并且完全离线运行,在低比特推理期间不引入额外开销。 ReRound策略代表了一种低比特量化的新方法。该方法适用于LLM以外的AI模型。本文重点关注其在小型LLM上的应用。
查看原文
查看缓存全文

缓存时间: 2026/08/13 23:24

论文页面 - ReRound:重构式舍入以解决无校准 LLM 量化中的中点歧义

来源:https://huggingface.co/papers/2608.11045 发布于 8月11日

·

He-Yen Hsieh 于 8月13日 提交

摘要

ReRound 使用条件扩散模型在低比特训练后量化过程中指导接近中点的权重的舍入,通过匹配前导奇异值来选择候选,从而提高小型 LLM 的精度,且不引入推理开销。

ReRound(Reconstructive Rounding)是一种 训练后量化 方法,解决了标准 最近舍入(RTN)方案在量化靠近量化区间中心的权重时固有的中点歧义问题。ReRound 从预训练 LLM 出发,训练一个 条件扩散模型,为 LLM 生成低比特权重的连续重构。这些重构权重作为引导信号,消除位于区间中点附近的权重的舍入方向歧义。为了将这种重构引导的舍入与常规 RTN 集成,ReRound 引入了一种 容差度量,用于衡量量化权重(而非最终量化整数)离中点有多远:位于中点周围容差区域内的量化权重使用基于扩散的重构进行量化,而更接近量化边界的权重则使用 RTN 进行量化。通过扫描容差参数,ReRound 生成多个候选量化整数权重矩阵,并选择反量化后权重矩阵中 奇异值 与原始全精度权重最接近的候选。被选中的候选决定了 ReRound 使用的容差参数。ReRound 对较小的 LLM 特别有效。在一系列此类模型上,它在 3 位和 4 位权重量化方面始终优于标准 RTN。与大量无校准方法相比,ReRound 实现了更优的精度,与依赖校准的方法相比也保持竞争力,并且完全离线运行,在低比特推理期间不引入额外开销。ReRound 策略代表了 低比特量化 的一种新方法。该方法适用于 LLM 之外的 AI 模型。本文重点研究其在小型 LLM 上的应用。

查看 arXiv 页面查看 PDF项目页面GitHub1添加到收藏

在您的 agent 中获取此论文:

hf papers read 2608\.11045

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.11045,即可从本页面链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.11045,即可从本页面链接到它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.11045,即可从本页面链接到它。

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到收藏,即可从本页面链接到它。

相似文章

ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

arXiv cs.AI

ReQuant introduces a backpropagation-free, fixed-grid discrete refinement stage for post-training quantization (PTQ) that iteratively improves initial quantized models while preserving the quantized format, showing consistent gains across various LLMs and bit-widths.