OrbitQuant:面向图像与视频扩散Transformer的数据无关量化方法

Hugging Face Daily Papers 论文

摘要

OrbitQuant提出了一种数据无关的扩散Transformer量化方法,消除了跨时间步和模态进行重新校准的需求,在FLUX.1和CogVideoX等模型的低位宽设置下实现了最先进的后训练量化水平。

扩散Transformer(DiT)在图像和视频生成领域达到了最先进水平,但其多步采样和不断增长的参数量使得推理成本高昂。后训练量化(PTQ)是自然的解决方案,然而DiT的激活值会随着时间步、提示词和引导分支而变化,迫使先前的方法为每个新检查点或模态重新拟合校准数据。我们提出OrbitQuant,一种数据无关的权重-激活量化器,通过归一化旋转基下的量化绕过范围估计。在该基下,随机排列分块Hadamard(RPBH)旋转将每个坐标集中在一个固定的已知边缘分布上,无论输入如何,因此单个Lloyd-Max码本即可服务于给定输入维度的所有时间步、提示词和层。我们将相同的量化器离线扩展到权重行,将旋转吸收到权重中,使其在每个线性层内部抵消,运行时仅对激活进行前向旋转。同样的方法可直接从图像迁移到视频,无需针对每种模态进行调优。在FLUX.1、Z-Image-Turbo、Wan 2.1和CogVideoX上,它在多个低位宽设置下达到了PTQ的最先进水平。同时,它将图像扩散Transformer的PTQ推进到W2A4,并保持可用的生成质量。
查看原文
查看缓存全文

缓存时间: 2026/07/06 10:36

论文页面 - OrbitQuant:面向图像和视频扩散变压器的数据无关量化

来源:https://huggingface.co/papers/2607.02461

摘要

OrbitQuant 利用归一化旋转基实现了扩散变压器的高效训练后量化,该基消除了跨不同时间步和模态重新校准的需求。

扩散变压器 (https://huggingface.co/papers?q=Diffusion%20transformers)(DiT)在图像和视频生成 (https://huggingface.co/papers?q=video%20generation) 领域达到了最先进的水平,但其多步采样和不断增长的参数量使得推理成本高昂。训练后量化 (https://huggingface.co/papers?q=Post-training%20quantization)(PTQ)是自然的解决方案,但 DiT 的激活值会随时间步、提示和指导分支发生变化,迫使先前的方法为每个新的检查点或模态重新拟合校准数据。我们提出了 OrbitQuant,这是一种数据无关的权重-激活量化器 (https://huggingface.co/papers?q=weight-activation%20quantizer),它通过在归一化旋转基中进行量化来绕过范围估计。在该基中,随机排列块-哈达玛 (https://huggingface.co/papers?q=randomized%20permuted%20block-Hadamard)(RPBH)旋转将每个坐标集中在一个固定的、已知的边际周围,而与输入无关,因此单个 Lloyd-Max 码书 (https://huggingface.co/papers?q=Lloyd-Max%20codebook) 即可服务于给定输入维度的所有时间步、提示和层。我们将相同的量化器扩展到权重行的离线量化,将旋转吸收到权重中,使其在每个线性层内部抵消,运行时仅需对激活值进行一次前向旋转。同样的配方无需针对每种模态进行调优即可从图像迁移到视频。在 FLUX.1、Z-Image-Turbo、Wan 2.1 和 CogVideoX 上,它在几种低位设置下为 PTQ 树立了新的标杆。它还推动图像扩散变压器 (https://huggingface.co/papers?q=diffusion%20transformers) 的 PTQ 达到了 W2A4 且具备可用的生成质量。

查看 arXiv 页面 (https://arxiv.org/abs/2607.02461)
查看 PDF (https://arxiv.org/pdf/2607.02461)
项目页面 (https://saurabhcantina.github.io/orbitquant/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02461)

在您的 agent 中获取这篇论文:

hf papers read 2607.02461

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

没有模型与本论文关联

在模型 README.md 中引用 arxiv.org/abs/2607.02461 即可在此页面建立链接。

引用本论文的数据集 0

没有数据集与本论文关联

在数据集 README.md 中引用 arxiv.org/abs/2607.02461 即可在此页面建立链接。

引用本论文的 Spaces 0

没有 Space 与本论文关联

在 Space README.md 中引用 arxiv.org/abs/2607.02461 即可在此页面建立链接。

包含本论文的收藏 1

相似文章

FourTune:迈向扩散模型全4比特高效后训练

arXiv cs.LG

FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。

基于平坦度的理论最优量化

arXiv cs.LG

介绍了平坦度度量与双向对角量化(BDQ)用于大型语言模型的训练后量化,实现了接近无损的4比特权重和激活量化,并在极低比特设置下取得了显著改进。

量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正

arXiv cs.LG

本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。

LoopQ:递归Transformer的量化

arXiv cs.LG

LoopQ是一种针对循环语言模型的后训练量化框架,解决了分布偏移、状态复用和误差累积问题。在4位权重和激活量化下,平均准确率提升68.8%。