Channel-wise Vector Quantization

Hugging Face Daily Papers 论文

摘要

通道级向量量化(Channel-wise Vector Quantization, CVQ)用通道级标记替换块级标记进行图像标记化,实现了一个下一通道预测框架(CAR),该框架通过逐步细化视觉细节生成图像,在重建和文本到图像生成性能上表现出色。

我们提出了通道级向量量化(Channel-wise Vector Quantization, CVQ),一种新颖的图像标记化范式,用通道级标记替换块级标记。与传统的向量量化(为每个块的特征向量分配一个离散标记)不同,CVQ对特征图的每个通道进行量化。这种表示将图像表示为视觉细节的离散级别,而不是空间块的网格。基于CVQ,我们引入了一种新的视觉自回归框架,采用“下一通道预测”。我们的通道级自回归(CAR)模型不是按光栅顺序逐块渲染图像,而是顺序预测图像通道,逐渐产生更丰富的视觉细节。具体来说,它首先勾勒全局结构,然后细化细粒度属性,类似于人类艺术家的创作流程。实验结果表明:(1)CVQ在无需任何额外技巧的情况下实现了100%的码本利用率,码本大小超过16K,并且显著提高了重建质量,优于传统VQ;(2)CAR在DPG上达到86.7,在GenEval上达到0.79,证明了其在文本到图像生成方面的强大效果。
查看原文
查看缓存全文

缓存时间: 2026/05/26 06:42

Paper page - Channel-wise Vector Quantization

Source: https://huggingface.co/papers/2605.26089

摘要

Channel-wise Vector Quantization 将图像标记化中的逐块(patch-wise)标记替换为逐通道(channel-wise)标记,从而构建了一个“下一通道预测”框架,通过逐步细化视觉细节来生成图像。

我们提出 Channel-wise Vector Quantization (https://huggingface.co/papers?q=Channel-wise%20Vector%20Quantization)(CVQ),这是一种全新的图像标记化 (https://huggingface.co/papers?q=image%20tokenization) 范式,用逐通道标记 (https://huggingface.co/papers?q=channel-wise%20tokens) 取代了传统的逐块标记 (https://huggingface.co/papers?q=patch-wise%20tokens)。与传统的向量量化 (https://huggingface.co/papers?q=vector%20quantization) 不同(后者为每个块的特征向量分配一个离散标记),CVQ 对特征图的每个通道分别进行量化。这种表示方式将图像刻画为视觉细节的离散层级,而非按空间块网格排列。基于 CVQ,我们引入了新的视觉自回归框架 (https://huggingface.co/papers?q=visual%20autoregressive%20framework),采用“下一通道预测 (https://huggingface.co/papers?q=next-channel%20prediction)”。我们的 Channel-wise Autoregressive (https://huggingface.co/papers?q=Channel-wise%20Autoregressive)(CAR)模型不再逐块按光栅顺序渲染图像,而是按顺序依次预测图像的各个通道,逐步生成越来越丰富的视觉细节。具体来说,它先勾勒出整体结构,再细化精细属性,类似于人类艺术家的创作流程。实验证明:(1) CVQ 在 16K+ 的码本大小下,无需任何额外技巧即可实现 100% 的码本利用率 (https://huggingface.co/papers?q=codebook%20utilization),并且相比传统 VQ 大幅提升了重建质量 (https://huggingface.co/papers?q=reconstruction%20quality);(2) CAR 模型取得了 86.7 的 DPG 分数 (https://huggingface.co/papers?q=DPG%20score) 和 0.79 的 GenEval 分数 (https://huggingface.co/papers?q=GenEval%20score),在文本到图像生成 (https://huggingface.co/papers?q=text-to-image%20generation) 任务中展现了强大的有效性。

查看 arXiv 页面 (https://arxiv.org/abs/2605.26089)查看 PDF (https://arxiv.org/pdf/2605.26089)项目页面 (https://github.com/songweii/CVQ)GitHub1 (https://github.com/songweii/CVQ)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.26089)

在你的 agent 中获取本文:

hf papers read 2605\.26089

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型:0

无模型链接本论文

在模型 README.md 中引用 arxiv.org/abs/2605.26089 以从此页面链接。

引用本论文的数据集:0

无数据集链接本论文

在数据集 README.md 中引用 arxiv.org/abs/2605.26089 以从此页面链接。

引用本论文的 Spaces:0

无 Space 链接本论文

在 Space README.md 中引用 arxiv.org/abs/2605.26089 以从此页面链接。

包含本论文的收藏:1

相似文章

ViQ:任意分辨率下的文本对齐视觉量化表示

Hugging Face Daily Papers

ViQ提出了一种视觉量化框架,在离散表示中平衡了语义丰富性和细节保留,通过文本对齐预训练和邻近表示学习,支持原生分辨率输入,实现高效的多模态训练。

UniSVQ: 2-bit统一标量-向量量化

arXiv cs.CL

UniSVQ提出了一种统一的2位量化框架,通过将码字参数化为整数格点的仿射变换,桥接了标量量化与向量量化,在标量方法中达到了最先进水平,并与向量方法性能相当且具有更高的吞吐量。

VQ-bench:可组合的向量量化框架

arXiv cs.AI

本文介绍了VQ-bench,一个用于组合和评测向量量化算法的统一框架,将25种常见量化器重新表示为原语流水线,并发布可复现的基准测试结果。

Qwen-Image-VAE-2.0 技术报告

Hugging Face Daily Papers

Qwen-Image-VAE-2.0 是一个高压缩变分自编码器套件,通过增强的架构、大规模训练和语义对齐策略,提升了重建保真度和可扩散性。