向量、乘积和标量量化的统一率失真视角

arXiv cs.LG 论文

摘要

本文提出了一种针对离散视觉标记化的统一率失真视角,解决了关于量化目标和比较的关键问题,并表明在受控条件下,向量量化实现了最低的失真。

arXiv:2609.02107v1 公告类型:新 摘要: 离散视觉标记化主要由向量、标量和乘积量化驱动,缺乏一个统一的概念框架来理解量化权衡。本文,我们提出了一种针对现代离散视觉标记化的统一率失真视角。通过将量化视为有损压缩,我们通过标记数量和码本大小来表征标称固定长度编码率,并将量化误差视为失真。在此框架内,我们解决了三个核心问题。首先,我们从理论和实证上表明,最小化失真,而不是最大化码本利用率,是重建保真度的主要内在目标,并与STE引起的梯度差异直接相关。其次,我们建立了两个关键的公平条件用于内在量化比较:控制潜在特征统计和强制相同的编码率。第三,在这些条件下,我们恢复了现代视觉标记化中的VQ-PQ-SQ失真层次,并实证表明现代VQ方法实现了最低的失真。这项工作为现代离散视觉标记化提供了基础性的率失真重构,解决了量化器评估中的模糊性,并提供了一个受控框架,用于在固定率约束下隔离内在量化有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:15

# 从统一的率失真视角看向量、乘积与标量量化
来源:https://arxiv.org/html/2609.02107  
德汉·孔  蒂姆·G·J·鲁德纳
多伦多大学  波士顿学院  
Vijil网站(https://vq-research.github.io/Rate-Distortion-Perspective/)  
代码与模型(https://github.com/VQ-Research/Rate-Distortion-Perspective)

###### 摘要
离散视觉词元化主要由向量量化、标量量化和乘积量化驱动,但目前缺乏一个统一的概念框架来理解量化中的权衡。本文提出一种针对现代离散视觉词元化的统一率失真视角。我们将量化视为有损压缩,通过词元数量和码本大小来表征名义上的固定长度编码率,并将量化误差视为失真。在此框架内,我们解决了三个核心问题。首先,我们从理论和实证两方面证明,最小化失真(而非最大化码本利用率)是重建保真度的主要内在目标,并与STE引起的梯度差异存在直接联系。其次,我们确立了内在量化比较的两个关键公平条件:控制潜变量特征统计特性和强制执行相同的编码率。第三,在这些条件下,我们恢复了现代视觉词元化中VQ–PQ–SQ的失真层级关系,并实证表明现代VQ方法实现了最低失真。这项工作为现代离散视觉词元化提供了一个基础性的率失真重构,解决了量化器评估中的模糊性,并为在固定速率约束下隔离内在量化有效性提供了一个受控框架。

## 1 引言
离散视觉词元化近年来取得了显著成功,这得益于向量量化\[Esser2020TamingTF,Sun2024AutoregressiveMB,Tian2024VisualAM\]、乘积量化\[Jgou2011ProductQF,Guo2024AddressingIC,Li2024ImageFolderAI\]和标量量化\[Mentzer2023FiniteSQ,yu2024language,zhao2024image,Han2024InfinitySB\]的进步。VQ研究的一个主要方向一直集中在通过改进码本更新、优化或参数化来提高码本利用率\[Lee2022AutoregressiveIG,Zheng2023OnlineCC,Zhu2024ScalingTC,Zhu2024AddressingRC,Shi2024TamingScalable,Chang2025FullVQ,Lu2026BeyondStationarity\]。尽管进展迅速,但利用率、失真和量化有效性之间的概念关系仍然相对不甚明了。特别是,高甚至完全的码本利用率并不一定意味着能忠实表示输入。这促使我们寻求一个更基本的框架来理解不同量化算法背后的目标和权衡。

本文提出一种针对量化的统一率失真视角来系统地解决这些考量。率失真理论提供了表征有损压缩的经典框架,并且也启发了联合优化编码率和重建失真的学习图像压缩方法\[Balle2017EndToEnd,Lei2024ApproachingRD,Zhang2024OptimalLattice,Jiang2026RDVQ\]。我们将率失真理论用作比较离散视觉量化器的分析框架,将失真定义为量化误差,将速率定义为由词元数量和码本大小决定的名义固定长度编码预算。在此视角下,我们解决了离散视觉词元化中的三个核心开放问题,总结见图1(https://arxiv.org/html/2609.02107#S1.F1)。

首先,我们研究现代视觉词元化中量化算法的主要优化目标。从率失真视角看,最小化失真(而非直接最大化码本利用率)是实现训练稳定性和高保真重建的关键。我们提供了支持失真最小化作为更基本优化原则的理论和实证证据。具体而言,我们证明了在温和条件下,最小化失真必然意味着完全的码本利用率,反之则不然。我们进一步建立了失真与由直通估计器(STE)\[Bengio2013EstimatingOP\]引起的梯度差异之间的直接联系。实证上,我们展示了失真与重建保真度(以rFID衡量)之间的相关性显著强于与码本利用率的相关性。这些结果促使我们超越码本利用率,形成以失真为中心的VQ优化视角,总结见图1(https://arxiv.org/html/2609.02107#S1.F1)(a),补充了先前对STE偏差的分析\[Huh2023StraighteningOT,Fifty2024RestructuringVQ\]以及近期解决码本坍缩的努力\[Zhu2024AddressingRC,Shi2024TamingScalable,Chang2025FullVQ,Lu2026BeyondStationarity\]。

> **图 1**:我们统一的量化率失真视角概述。  
> (a) **主要目标**:失真是比码本利用率更根本的标准,与利用率、STE引起的梯度差异和重建保真度有直接联系。  
> (b) **公平比较**:内在比较要求匹配的潜变量特征分布和相同的名义固定长度速率。  
> (c) **内在有效性**:在匹配的潜变量分布和固定速率下,VQ、PQ和SQ满足 SQ⊆PQ⊆VQ,意味着 $\mathcal{E}^{*}_{\text{VQ}} \leq \mathcal{E}^{*}_{\text{PQ}} \leq \mathcal{E}^{*}_{\text{SQ}}$。

其次,我们确立了公平比较量化算法内在有效性的两个基本条件,如图1(https://arxiv.org/html/2609.02107#S1.F1)(b)所示。首先,所比较算法的潜变量特征分布必须被控制。特别是在全局重缩放下,可实现的最小平方量化失真与潜变量方差成比例变化,因此特征统计特性的差异可能混淆量化器有效性的比较。其次,所有算法必须在相同的名义固定长度编码率 $R = T \log_{2} K$ 下运行,该速率由视觉词元数量 $T$ 和离散码空间大小 $K$ 共同决定。只有在匹配的潜变量分布和编码率下,不同量化算法的内在有效性才能被有意义地比较。

第三,我们在严格控制条件下检验量化算法的内在有效性。如图1(https://arxiv.org/html/2609.02107#S1.F1)(c)所示,SQ、PQ和VQ形成一个嵌套层级,其中VQ推广了PQ,PQ推广了SQ,这意味着VQ具有更大的建模灵活性,且不会产生更高的最优失真。神经图像压缩的相关工作也类似地表明,当利用跨维度依赖性时,向量或格点量化可以实现比标量量化更低的失真\[Lei2024ApproachingRD,Zhang2024OptimalLattice\]。然而,早期的视觉词元化研究报道了VQ的严重码本坍缩问题,尤其是在使用大型码本时\[Dhariwal2020JukeboxAG,Takida2022SQVAEVB,Yu2021VectorquantizedIM,Lee2022AutoregressiveIG,Zheng2023OnlineCC\],导致其在先前工作中的经验性能不如SQ和PQ\[Mentzer2023FiniteSQ,yu2024language,zhao2024image,Guo2024AddressingIC\]。为解决这一明显冲突,我们研究了在受控的固定速率条件下,VQ、PQ和SQ之间的经典失真层级能否在现代视觉词元化中实现。除了这种嵌套排序外,我们还表明VQ可以利用低维源结构实现比PQ和SQ严格更优的失真缩放。我们的实证研究进一步表明,先进的VQ算法\[Fang2026distributional,Fang2026VQTransplant\]在上述两个公平条件下始终能实现更低的失真和更好的重建。

我们的主要贡献如下:
1.  **我们将失真最小化确立为现代视觉量化的一个基本内在优化原则。** 我们证明了在温和条件下,失真最小化意味着完全的码本利用率,反之则不然。我们进一步将量化失真与由直通估计器引起的梯度差异联系起来。
2.  **我们确定了量化算法公平内在比较的两个基本条件。** 我们表明,比较必须控制潜变量特征的尺度和编码率,因为这两个因素的任何差异都可能掩盖量化器本身的内在有效性。
3.  **我们表征了现代视觉词元化中的VQ–PQ–SQ失真层级,并表明VQ可以利用低维源结构实现比PQ和SQ严格更优的失真缩放。** 实证上,在受控比较中,现代VQ方法在解码器适配后实现了最低的失真和最佳的重建。

## 2 背景
### 2.1 离散视觉词元化
离散视觉词元化器将图像映射为离散符号序列,这些序列随后可由生成模型进行建模\[Oord2017NeuralDR,Esser2020TamingTF,Sun2024AutoregressiveMB,Tian2024VisualAM\]。一个典型的离散词元化器由编码器 $\mathcal{E}_{\theta}$、量化模块 $\mathcal{Q}_{\phi}$ 和解码器 $\mathcal{D}_{\varphi}$ 组成。给定图像 $\bm{x} \in \mathbb{R}^{H \times W \times 3}$,编码器生成连续潜变量特征 $\bm{z}_{e} = \mathcal{E}_{\theta}(\bm{x}) \in \mathbb{R}^{h \times w \times d}, \quad h=H/f,\; w=W/f$,其中 $f$ 表示空间下采样因子,$d$ 为潜变量维度。在每个空间位置 $(i,j)$,量化器将连续特征 $\bm{z}^{ij}_{e} \in \mathbb{R}^{d}$ 映射到离散表示:$r^{ij} = \mathcal{I}_{\phi}(\bm{z}^{ij}_{e}), \quad \bm{z}^{ij}_{q} = \mathcal{Q}_{\phi}(\bm{z}^{ij}_{e})$,其中 $r^{ij}$ 表示离散符号,$\bm{z}^{ij}_{q}$ 为量化后的表示。生成的离散符号可用作生成建模的视觉词元,而量化后的潜变量则被解码为 $\hat{\bm{x}} = \mathcal{D}_{\varphi}(\bm{z}_{q})$。不同的量化算法对从 $\bm{z}_{e}$ 到 $\bm{z}_{q}$ 的映射施加了不同的结构。在本工作中,我们关注三个广泛使用的族:向量量化(VQ)、乘积量化(PQ)和标量量化(SQ),下面将分别介绍。

### 2.2 向量量化
向量量化(VQ)联合离散化整个 $d$ 维特征向量\[Oord2017NeuralDR\]。给定一个可学习的码本 $\phi = \{ \bm{e}_{k} \}_{k=1}^{K} \subset \mathbb{R}^{d}$,包含 $K$ 个码向量,VQ将每个连续特征 $\bm{z}^{ij}_{e}$ 分配给其最近的码本条目:$r^{ij} = \arg\min_{k \in \{1,\ldots,K\}} \| \bm{z}^{ij}_{e} - \bm{e}_{k} \|_{2}^{2}, \quad \bm{z}^{ij}_{q} = \bm{e}_{r^{ij}}$。因此,每个空间特征由 $K$ 个 $d$ 维码向量中的一个表示。VQ中一个长期的优化挑战是*码本坍缩*,即只有一部分可用的码向量被频繁选择\[Dhariwal2020JukeboxAG,Takida2022SQVAEVB,Yu2021VectorquantizedIM,Lee2022AutoregressiveIG,Zheng2023OnlineCC\]。对于大型码本,这个问题可能变得尤为突出\[Zheng2023OnlineCC,Mentzer2023FiniteSQ\]。因此,大量工作致力于开发改进的码本更新、优化程序和参数化以提高码本使用率\[Razavi2019GeneratingDH,Williams2020HierarchicalQA,Zhang2023RegularizedVQ,Zhu2024ScalingTC,Zhu2024AddressingRC,Shi2024TamingScalable,Chang2025FullVQ,Lu2026BeyondStationarity\]。其他工作则研究了由量化不可微性引起的困难,包括直通估计器和替代梯度变换\[Huh2023StraighteningOT,Fifty2024RestructuringVQ\]。

### 2.3 乘积量化
乘积量化(PQ)将一个 $d$ 维特征向量分解为 $M$ 个低维子向量,并独立量化每个子向量\[Jgou2011ProductQF,Guo2024AddressingIC,Li2024ImageFolderAI\]。具体而言,$\bm{z}^{ij}_{e} = \bigoplus_{m=1}^{M} \bm{z}^{ij}_{m}, \quad \bm{z}^{ij}_{m} \in \mathbb{R}^{d_{m}}, \quad \sum_{m=1}^{M} d_{m} = d$,其中 $\bigoplus$ 表示按通道连接。每个子向量使用一个独立的子码本 $\phi_{m} = \{ \bm{e}_{m,k} \}_{k=1}^{n_{m}} \subset \mathbb{R}^{d_{m}}$ 进行量化,使得 $r^{ij}_{m} = \arg\min_{k \in \{1,\ldots,n_{m}\}} \| \bm{z}^{ij}_{m} - \bm{e}_{m,k} \|_{2}^{2}, \quad \hat{\bm{z}}^{ij}_{m} = \bm{e}_{m,r^{ij}_{m}}$。完整的量化特征则为 $\bm{z}^{ij}_{q} = \bigoplus_{m=1}^{M} \hat{\bm{z}}^{ij}_{m}$。$M$ 个子码本共同产生 $K = \prod_{m=1}^{M} n_{m}$ 个可能的复合码字。因此,PQ可以使用 $\sum_{m=1}^{M} n_{m}$ 个显式存储的子码本条目来表示一个组合离散空间。为了后续分析,我们使用 $K$ 表示这个*复合码空间大小*,而非显式存储的向量数量。

### 2.4 标量量化
标量量化(SQ)独立离散化潜变量表示的标量分量,可以视为PQ中 $M=d$ 的极端分解情况。将 $\bm{z}^{ij}_{e} = \bigoplus_{m=1}^{d} z^{ij}_{m}, \quad z^{ij}_{m} \in \mathbb{R}$,每个标量分量使用一个标量码本 $\phi_{m} = \{ e_{m,k} \}_{k=1}^{n_{m}} \subset \mathbb{R}$ 独立量化。对应的离散索引和量化值为 $r^{ij}_{m} = \arg\min_{k \in \{1,\ldots,n_{m}\}} | z^{ij}_{m} - e_{m,k} |^{2}, \quad \hat{z}^{ij}_{m} = e_{m,r^{ij}_{m}}$。生成的量化向量为 $\bm{z}^{ij}_{q} = \bigoplus_{m=1}^{d} \hat{z}^{ij}_{m}$,复合码空间大小为 $K = \prod_{m=1}^{d} n_{m}$。现代视觉词元化器以不同方式实例化此通用标量分解。FSQ在每个潜变量维度上使用少量有限标量级别\[Mentzer2023FiniteSQ\]。LFQ对每个量化坐标使用二值\[yu2024language\],而BSQ则结合了二值量化和超球面归一化\[zhao2024image\]。

## 3 走向量化算法的受控比较
跨独立训练的视觉词元化器比较量化算法无法隔离量化器本身的贡献。端到端词元化器性能受量化模块和周围训练系统的共同影响,包括编码器-解码器容量和架构、判别器设计、训练数据、优化计划和计算预算。这些因素在现有词元化器之间可能存在显著差异。

相似文章

UniSVQ: 2-bit统一标量-向量量化

arXiv cs.CL

UniSVQ提出了一种统一的2位量化框架,通过将码字参数化为整数格点的仿射变换,桥接了标量量化与向量量化,在标量方法中达到了最先进水平,并与向量方法性能相当且具有更高的吞吐量。

VQ-bench:可组合的向量量化框架

arXiv cs.AI

本文介绍了VQ-bench,一个用于组合和评测向量量化算法的统一框架,将25种常见量化器重新表示为原语流水线,并发布可复现的基准测试结果。