Channel-wise Vector Quantization
摘要
通道级向量量化(Channel-wise Vector Quantization, CVQ)用通道级标记替换块级标记进行图像标记化,实现了一个下一通道预测框架(CAR),该框架通过逐步细化视觉细节生成图像,在重建和文本到图像生成性能上表现出色。
查看缓存全文
缓存时间: 2026/05/26 06:42
Paper page - Channel-wise Vector Quantization
Source: https://huggingface.co/papers/2605.26089
摘要
Channel-wise Vector Quantization 将图像标记化中的逐块(patch-wise)标记替换为逐通道(channel-wise)标记,从而构建了一个“下一通道预测”框架,通过逐步细化视觉细节来生成图像。
我们提出 Channel-wise Vector Quantization (https://huggingface.co/papers?q=Channel-wise%20Vector%20Quantization)(CVQ),这是一种全新的图像标记化 (https://huggingface.co/papers?q=image%20tokenization) 范式,用逐通道标记 (https://huggingface.co/papers?q=channel-wise%20tokens) 取代了传统的逐块标记 (https://huggingface.co/papers?q=patch-wise%20tokens)。与传统的向量量化 (https://huggingface.co/papers?q=vector%20quantization) 不同(后者为每个块的特征向量分配一个离散标记),CVQ 对特征图的每个通道分别进行量化。这种表示方式将图像刻画为视觉细节的离散层级,而非按空间块网格排列。基于 CVQ,我们引入了新的视觉自回归框架 (https://huggingface.co/papers?q=visual%20autoregressive%20framework),采用“下一通道预测 (https://huggingface.co/papers?q=next-channel%20prediction)”。我们的 Channel-wise Autoregressive (https://huggingface.co/papers?q=Channel-wise%20Autoregressive)(CAR)模型不再逐块按光栅顺序渲染图像,而是按顺序依次预测图像的各个通道,逐步生成越来越丰富的视觉细节。具体来说,它先勾勒出整体结构,再细化精细属性,类似于人类艺术家的创作流程。实验证明:(1) CVQ 在 16K+ 的码本大小下,无需任何额外技巧即可实现 100% 的码本利用率 (https://huggingface.co/papers?q=codebook%20utilization),并且相比传统 VQ 大幅提升了重建质量 (https://huggingface.co/papers?q=reconstruction%20quality);(2) CAR 模型取得了 86.7 的 DPG 分数 (https://huggingface.co/papers?q=DPG%20score) 和 0.79 的 GenEval 分数 (https://huggingface.co/papers?q=GenEval%20score),在文本到图像生成 (https://huggingface.co/papers?q=text-to-image%20generation) 任务中展现了强大的有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2605.26089)查看 PDF (https://arxiv.org/pdf/2605.26089)项目页面 (https://github.com/songweii/CVQ)GitHub1 (https://github.com/songweii/CVQ)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.26089)
在你的 agent 中获取本文:
hf papers read 2605\.26089
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型:0
无模型链接本论文
在模型 README.md 中引用 arxiv.org/abs/2605.26089 以从此页面链接。
引用本论文的数据集:0
无数据集链接本论文
在数据集 README.md 中引用 arxiv.org/abs/2605.26089 以从此页面链接。
引用本论文的 Spaces:0
无 Space 链接本论文
在 Space README.md 中引用 arxiv.org/abs/2605.26089 以从此页面链接。
包含本论文的收藏:1
相似文章
ViQ:任意分辨率下的文本对齐视觉量化表示
ViQ提出了一种视觉量化框架,在离散表示中平衡了语义丰富性和细节保留,通过文本对齐预训练和邻近表示学习,支持原生分辨率输入,实现高效的多模态训练。
UniSVQ: 2-bit统一标量-向量量化
UniSVQ提出了一种统一的2位量化框架,通过将码字参数化为整数格点的仿射变换,桥接了标量量化与向量量化,在标量方法中达到了最先进水平,并与向量方法性能相当且具有更高的吞吐量。
VQ-bench:可组合的向量量化框架
本文介绍了VQ-bench,一个用于组合和评测向量量化算法的统一框架,将25种常见量化器重新表示为原语流水线,并发布可复现的基准测试结果。
在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化
本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。
Qwen-Image-VAE-2.0 技术报告
Qwen-Image-VAE-2.0 是一个高压缩变分自编码器套件,通过增强的架构、大规模训练和语义对齐策略,提升了重建保真度和可扩散性。