Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化
摘要
本文介绍了Tail-Aware HiFloat4,这是一种针对Wan2.2文本到视频扩散模型的W4A4训练后量化方法,该方法采用激活尾感知百分位校准来缓解异常值的影响,同时保持HiFloat4算术运算不变。
arXiv:2605.26628v1 Announce Type: new
摘要:本报告描述了Tail-Aware HiFloat4,这是我们参与低位文本到视频生成量化挑战赛的提交方案。我们的方法将公开的ViDiT-Q训练后量化流程适配到Wan2.2的HiFloat4数值格式下。我们对Wan2.2 Transformer模块中的主要线性层进行W4A4 HiFloat4伪量化,将数值敏感的边界层保持高精度,并引入激活尾感知百分位校准模块用于通道掩码构建。结合紧凑的PTQ状态恢复,该设计减少了罕见校准异常值的影响,同时保持了运行时HiFloat4算术运算和采样流程不变。
查看缓存全文
缓存时间: 2026/05/27 09:06
# W4A4 后训练量化应用于 Wan2.2
冯占峰与郭帅对本文贡献相等。
来源:https://arxiv.org/html/2605.26628
## Tail-Aware HiFloat4:面向 Wan2.2 的 W4A4 后训练量化††thanks:冯占峰与郭帅对本文贡献相等。
###### 摘要
本报告介绍了 Tail-Aware HiFloat4,这是我们在低比特文本生成视频量化挑战赛中的参赛方案。我们的方法将公开的 ViDiT-Q 后训练量化管线适配至 Wan2.2,并采用 HiFloat4 数值格式。我们对 Wan2.2 两个 Transformer 模块中的主要线性层应用 W4A4 HiFloat4 伪量化,将数值敏感的边界模块保留为高精度,并引入一个基于激活尾部感知的分位数校准模块用于通道掩码构建。结合紧凑的 PTQ 状态恢复,该设计减少了罕见校准异常值的影响,同时保持运行时 HiFloat4 算术和采样管线不变。
## I. 引言
扩散模型已成为视觉生成器的重要家族[8 (https://arxiv.org/html/2605.26628#bib.bib1),18 (https://arxiv.org/html/2605.26628#bib.bib2)],而扩散Transformer进一步提升了高分辨率图像和视频合成的可扩展性[17 (https://arxiv.org/html/2605.26628#bib.bib3),20 (https://arxiv.org/html/2605.26628#bib.bib4),9 (https://arxiv.org/html/2605.26628#bib.bib5),7 (https://arxiv.org/html/2605.26628#bib.bib6),12 (https://arxiv.org/html/2605.26628#bib.bib7),21 (https://arxiv.org/html/2605.26628#bib.bib8)]。其质量很大程度上依赖于在去噪时间步上反复评估的大型Transformer块、宽前馈网络和注意力投影。这使得推理在内存和计算上都非常昂贵。这一成本在视频生成中尤为明显,因为时间长度和空间分辨率会成倍增加模型处理的潜在令牌数量。
因此,低比特推理对于部署具有吸引力。后训练量化(PTQ)尤其相关,因为它不需要重新训练大型生成模型。然而,激进的 W4A4 量化对扩散Transformer来说很困难。激活值会随着去噪时间步、空间和时序令牌、提示条件以及无分类器指导分支而变化。过于保守的校准统计量可能会保留罕见的异常值,但会将有限的 4 比特表示范围浪费在仅偶尔出现的值上。相反,过于激进的裁剪可能会损害语义保真度和时间一致性。
ICME 2026 低比特大模型量化挑战赛正是针对这一实际场景。在 HiFloat4 赛道中,模型必须使用提供的 4 比特浮点格式,并且最多只保留少量 Transformer 块为高精度。我们的解决方案遵循用于扩散Transformer的公开 ViDiT-Q PTQ 工作流[27 (https://arxiv.org/html/2605.26628#bib.bib11)],但将其适配至 Wan2.2 挑战管线。Wan2.2-I2V-A14B[22 (https://arxiv.org/html/2605.26628#bib.bib9)] 包含两个 Transformer 模块,并通过图像到视频接口进行评估。由于任务是提示驱动的,我们在校准和推理中均保持固定的占位图像条件,以便比较结果隔离量化的影响。
本文介绍了 Tail-Aware HiFloat4,一个面向 Wan2.2 的简洁 W4A4 HiFloat4 PTQ 系统。该系统有三个设计目标。首先,它应遵循挑战数值格式,在目标线性层中对权重和激活均使用 HiFloat4。其次,它应足够稳定以支持双Transformer的 Wan2.2 骨干网络,通过将边界模块(如嵌入层和输出投影层)保留为高精度。第三,它应通过基于分位数的统计量,使校准阶段对激活尾部不那么敏感。
主要贡献总结如下:
- • 我们将 ViDiT-Q 风格的 PTQ 管线适配至 Wan2.2-I2V-A14B,并对两个 Wan2.2 Transformer 模块中的主要线性层应用 HiFloat4 W4A4 伪量化。
- • 我们引入了尾部感知的分位数激活统计量用于通道掩码构建,在 SmoothQuant 风格的平衡路径中替换了硬最大值统计量。
- • 我们提供了一种紧凑的 PTQ 检查点格式,存储推理时的量化增量,而不是复制完整的 BF16 Transformer 权重。
- • 我们在匹配的 Wan2.2 生成设置下评估了最终的 W4A4 系统,并报告了在成像质量、美学质量、一致性和运动平滑度指标上的主要质量权衡。
## II. 相关工作
### II-A 后训练量化
后训练量化在无需完整再训练成本的情况下压缩预训练神经网络。早期的面向部署工作表明,量化整数推理可以显著降低卷积模型的存储流量和算术成本[11 (https://arxiv.org/html/2605.26628#bib.bib12)]。随后的 PTQ 方法改进了校准和舍入行为,包括自适应舍入预训练权重[16 (https://arxiv.org/html/2605.26628#bib.bib13)]和针对大型Transformer的逐层重建[5 (https://arxiv.org/html/2605.26628#bib.bib14)]。Transformer PTQ 还研究了激活异常值和混合数值路径。Dettmers 等人[4 (https://arxiv.org/html/2605.26628#bib.bib15)] 为大型Transformer隔离了异常特征,而 ZeroQuant 将分组量化和蒸馏结合用于大型Transformer[25 (https://arxiv.org/html/2605.26628#bib.bib16)]。SmoothQuant[24 (https://arxiv.org/html/2605.26628#bib.bib17)] 通过逐通道缩放将部分激活量化难度转移到权重上,AWQ[14 (https://arxiv.org/html/2605.26628#bib.bib18)] 进一步强调通过激活感知来保护显著权重,而 QuaRot[1 (https://arxiv.org/html/2605.26628#bib.bib19)] 通过等价旋转去除异常值。我们的方法遵循激活感知缩放的观点,但侧重于在固定的 HiFloat4 格式下,如何估计用于 W4A4 视频生成的激活统计量。
### II-B 扩散Transformer的量化
扩散模型不同于标准判别网络,因为同一网络需要在多个去噪时间步和条件状态下进行评估。PTQ4DM[19 (https://arxiv.org/html/2605.26628#bib.bib20)] 和 Q-Diffusion[13 (https://arxiv.org/html/2605.26628#bib.bib21)] 表明,与时间步相关的激活分布使得扩散量化与标准图像分类 PTQ 有本质不同。EfficientDM[6 (https://arxiv.org/html/2605.26628#bib.bib22)] 研究了用于低比特扩散模型的高效量化感知适配。更近期的工作聚焦于基于Transformer的生成器:PTQ4DiT[23 (https://arxiv.org/html/2605.26628#bib.bib23)]、Q-DiT[2 (https://arxiv.org/html/2605.26628#bib.bib24)] 和 VQ4DiT[3 (https://arxiv.org/html/2605.26628#bib.bib25)] 研究了扩散Transformer的后训练量化,其中注意力和前馈投影主导了算术计算。ViDiT-Q[27 (https://arxiv.org/html/2605.26628#bib.bib11)] 进一步识别了激活变化的多个维度,包括时间步级、令牌级、条件级和通道级变化。它结合了校准、通道平衡、可选旋转和针对敏感模块的混合精度。我们使用 ViDiT-Q 作为公开的 PTQ 基础,但针对 Wan2.2 挑战设置和 HiFloat4 格式进行了调整。
### II-C 视频生成评估
文本到视频生成已从早期的Transformer和扩散系统演变为更大的开放视频基础模型[20 (https://arxiv.org/html/2605.26628#bib.bib4),9 (https://arxiv.org/html/2605.26628#bib.bib5),7 (https://arxiv.org/html/2605.26628#bib.bib6),12 (https://arxiv.org/html/2605.26628#bib.bib7),21 (https://arxiv.org/html/2605.26628#bib.bib8)]。其质量是多维的:量化模型可以在保持帧级美学质量的同时,降低主体身份、提示对齐或时间连贯性。VBench[10 (https://arxiv.org/html/2605.26628#bib.bib26)] 从成像质量、美学质量、整体一致性、主体一致性和运动平滑度等维度评估视频生成。这些指标对于诊断低比特视频生成很有用,因为 W4A4 量化的失败模式无法通过单一评分捕获。
### II-D HiFloat4 格式
HiFloat4 是一种用于低比特推理的 4 比特面向浮点数值格式[15 (https://arxiv.org/html/2605.26628#bib.bib27)]。在挑战设置中,数值格式是固定的,因此方法不应重新定义表示。因此,我们将 HiFloat4 视为一个预定义的量化和反量化映射,用于权重和激活。所提出的分位数校准仅改变用于准备通道掩码的 PTQ 统计量;它不会改变 HiFloat4 算术。
## III. 预备知识
### III-A PTQ 符号
我们考虑对预训练生成器 fθ 进行后训练量化,而不通过梯度训练更新原始参数。对于张量 z,通用的伪量化操作可以写为:
D(Q(z; Δ, C); Δ) (1)
其中 Q 在尺度或格式参数 Δ 下将值映射到低精度码集 C,而 D 将低精度码映射回浮点数以进行模拟。整数 PTQ 通常选择具有显式尺度和零点的统一码集。在本文中,码集和反量化行为由 HiFloat4 工具包决定。因此,我们将权重和激活路径写为:
Ŵ = HiF4(W), x̂ = HiF4(x), (2)
其中 HiF4(·) 表示发布的反量化操作符。PTQ 算法负责准备更易于此固定操作符表示的变换后张量。
### III-B 通道平衡
通道平衡使用对角掩码在量化前重新分配激活和权重之间的动态范围。对于线性层,浮点计算在变换下保持不变:
x W^T = (x M) (W M^{-1})^T, M = diag(m). (3)
然而,量化后,m 的选择会改变近似误差,因为 HiF4(x M) 和 HiF4(W M^{-1}) 具有不同的有效范围。SmoothQuant 风格的方法根据权重和激活幅度构造 m。这使得校准统计量对 W4A4 性能至关重要:过度强调罕见异常值的激活估计会使常见激活范围过于粗糙,而裁剪过于激进的估计可能会去除重要的语义信号。
### III-C Wan2.2 挑战设置
Wan2.2-I2V-A14B[22 (https://arxiv.org/html/2605.26628#bib.bib9)] 是一个包含两个 Transformer 模块的图像到视频模型。在挑战协议中,文本提示提供语义条件,一个固定的占位图像提供所需的图像条件。目标层是 Transformer 模块内部的线性投影。该方法不改变调度器、提示处理、视频分辨率、帧数或 HiFloat4 算术。这种分离对于可相机复现性很重要:BF16 和 W4A4 运行之间的差异应来自于量化和 PTQ 状态恢复,而不是由于改变的采样协议。
## IV. 方法
### IV-A 概述
我们的管线包括校准、PTQ 状态构建和量化推理。校准在 BF16 Wan2.2 模型上运行一个小型提示集,并估计两个 Transformer 模块中线性层的输入激活统计量。PTQ 将选定的线性投影替换为 HiFloat4 量化对应物,从收集的统计量构造逐通道掩码,并形成紧凑的量化状态。量化推理将此状态应用于原始 Wan2.2 检查点,并使用相同的采样配置生成视频。
图 1 (https://arxiv.org/html/2605.26628#S4.F1) 显示了该过程。校准和推理接口均使用相同的固定占位图像条件,因为 Wan2.2 生成器遵循图像到视频的公式。因此,BF16 和 W4A4 运行共享相同的采样协议,剩余差异可归因于量化和提示变化。算法 1 (https://arxiv.org/html/2605.26628#alg1) 给出了用于构建紧凑状态的逐层 PTQ 过程。
<figure>
<img>图 1:所提出的面向 Wan2.2 的 Tail-Aware HiFloat4 W4A4 PTQ 系统管线。校准从 BF16 模型收集激活统计量,PTQ 构建尾部感知分位数校准的通道掩码和紧凑状态,推理在保持基础采样器不变的情况下恢复这些状态。</img>
<figcaption>图 1</figcaption>
</figure>
**算法 1** Tail-Aware 分位数校准的 HiF4 PTQ
输入:基础模型 fθ、校准提示 P、分位数 p、平衡系数 α
输出:紧凑 PTQ 状态 S
1: for 每个目标线性层 ℓ do
2: 在 P 上收集输入激活 xℓ
3: a_i ← Q_p({|x_{ℓ,j,i}|}_j)
4: w_i ← max_o |W_{ℓ,o,i}|
5: m_i ← w_i^α / (a_i + ε)^{1-α}
6: W̃_ℓ ← W_ℓ diag(m)^{-1}
7: Ŵ_ℓ ← HiF4(W̃_ℓ)
8: 在 S 中存储层掩码和量化状态
9: end for
### IV-B HiFloat4 量化线性层
设一个浮点线性层为:
y = x W^T + b (4)
其中 x 是输入激活,W 是权重矩阵,b 是偏置。对于每个选定的投影,权重路径对通道平衡后的权重应用 HiFloat4 量化和反量化,而激活路径对在线的输入激活应用相同的数值格式。量化轴遵循线性操作的自然矩阵维度:权重在输出通道上量化,激活在特征通道上量化。
Wan2.2-I2V-A14B 包含两个 Transformer 模块,我们对两者应用相同的转换规则。匹配的注意力投影和前馈投影被量化。归一化层、嵌入相关层、块嵌入、最终投影和输出头风格模块保留为 BF16 以保证稳定性。该配置还支持在两个 Transformer 模块中最多保留两个 Transformer 块为高精度,符合 HiFloat4 挑战规则。在提交的配置中,没有完整的 Transformer 块被保留为高精度。
### IV-C Tail-Aware 分位数校准
对于每个目标线性层,钩子收集输入激活的绝对值。设 x_{j,i} 表示令牌/样本索引 j 处通道 i 的激活值。一个保守的校准统计量是最大绝对值:
a_i^max = max_j |x_{j,i}|. (5)
该统计量避免了裁剪校准观测值,但可能被少量罕见异常值主导。在 W4A4 激活量化下,这种尾部代价很高,因为可表示的值很稀疏。
我们转而采用高分位数统计量:
a_i^p = Q_p({|x_{j,i}|}_j) (6)
其中 Q_p 返回集合的第 p 分位数。p 的典型值为 0.999 或 0.9995。该统计量排除了轻微的异常值,同时保留了激活动态范围的主要部分。随后,通道掩码由标准的 SmoothQuant 风格构造:m_i = w_i^α / (a_i^p + ε)^{1-α},其中 w_i 是权重的通道级最大值,α 是一个平衡系数。在 W4A4 设置中,权重量化通常不是主要瓶颈,因为权重是静态的且可以离线校准。但激活必须在运行时量化,因此对 α 的选择敏感。在实践中,我们通过验证小验证集上的生成质量来调整 α。
### IV-D 紧凑 PTQ 状态
预训练检查点通常将权重存储为 BF16。在挑战中,量化状态必须存储为从 BF16 权重计算得到的 PTQ 增量。为了最小化状态大小,我们存储每个层的通道掩码 m 和量化码本元数据(例如 HiFloat4 格式的尺度和指数偏移)。这些增量(掩码和码本参数)在推理时与原始 BF16 权重结合以重建量化操作。状态结构如下:
S_ℓ = {mask_ℓ, codebook_meta_ℓ}. (7)
掩码 mask_ℓ 是一个浮点向量,大小等于输入通道数。codebook_meta 包含每个量化张量的一个标量尺度参数。该设计避免了存储全精度的重复权重,同时允许在推理时高效恢复量化操作。如表 I 所示,总状态大小远小于原始 BF16 权重。
## V. 实验
### V-A 设置
**模型与数据。** 我们使用 Wan2.2-I2V-A14B(140 亿参数)作为基础模型。校准使用来自挑战赛提示集的 98 个文本-视频提示。由于 Wan2.2 是图像到视频模型,我们在校准和推理中均使用固定的占位图像条件。
**评估指标。** 我们报告 VBench[10 (https://arxiv.org/html/2605.26628#bib.bib26)] 的五个维度:成像质量(IQ)、美学质量(AQ)、整体一致性(OC)、主体一致性(SC)和运动平滑度(MS)。此外,我们还报告 CLIP 得分以衡量文本-视频对齐。
**基线。** 我们将 W4A4 结果与全精度 BF16 基线进行比较。由于挑战数值格式已固定,我们没有比较其他量化方法。
### V-B 结果
表 I 总结了主要结果。在 W4A4 量化下,所有 VBench 指标相对于 BF16 基线的下降均很小。
**表 I:Wan2.2-I2V-A14B 在 BF16 和 W4A4 HiFloat4 下的 VBench 指标。**
| 方法 | IQ | AQ | OC | SC | MS | CLIP |
|----------|-------|-------|-------|-------|-------|-------|
| BF16 | 0.832 | 0.611 | 0.785 | 0.912 | 0.923 | 0.295 |
| W4A4 (ours) | 0.825 | 0.601 | 0.778 | 0.908 | 0.915 | 0.290 |
**状态大小分析。** 紧凑的 PTQ 状态占大约 15 MB,而原始 BF16 权重约为 28 GB。这意味着状态大小减少了约 2000 倍。
**消融研究。** 我们移除 tail-aware 分位数校准(替代为最大绝对值统计量)并进行相同评估。结果如表 II 所示。使用硬最大值统计量会导致各指标下降 0.5–1.5%,表明 tail-aware 校准是有效的。
**表 II:尾部感知分位数校准的消融。** 将分位数校准替换为硬最大值会降低性能。
| 校准方法 | IQ | AQ | OC | SC | MS | CLIP |
|----------|-------|-------|-------|-------|-------|-------|
| 分位数 (ours) | 0.825 | 0.601 | 0.778 | 0.908 | 0.915 | 0.290 |
| 最大值 | 0.818 | 0.592 | 0.769 | 0.901 | 0.909 | 0.285 |
## VI. 结论
本文介绍了 Tail-Aware HiFloat4,一个用于 Wan2.2-I2V-A14B 的 W4A4 HiFloat4 PTQ 系统。通过保留边界模块的高精度、引入尾部感知分位数校准和紧凑状态,系统在 W4A4 下实现了与 BF16 相近的质量,同时大幅减小了存储开销。结果证明了低比特视频生成的可行性,并为未来挑战提供了基线。
**致谢。** 作者感谢 ICME 2026 挑战赛组织者和 HiFloat4 格式提供者。
---
**参考文献**
[1] Ashkboos, S., et al. QuaRot: Outlier-free 4-bit Inference in Rotated LLMs. *NeurIPS 2024*.
[2] Chen, L., et al. Q-DiT: Accurate Post-Training Quantization for Diffusion Transformers. *arxiv preprint 2405.17551*, 2024.
[3] Dai, Z., et al. VQ4DiT: Efficient Post-Training Quantization for Diffusion Transformers. *arxiv preprint 2410.02387*, 2024.
[4] Dettmers, T., et al. LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale. *NeurIPS 2022*.
[5] Frantar, E., et al. GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers. *ICLR 2023*.
[6] He, Y., et al. EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion Models. *ICLR 2024*.
[7] Ho, J., et al. Imagen Video: High Definition Video Generation with Diffusion Models. *arxiv preprint 2210.02303*, 2022.
[8] Ho, J., et al. Denoising Diffusion Probabilistic Models. *NeurIPS 2020*.
[9] Huang, Z., et al. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer. *arxiv preprint 2408.06072*, 2024.
[10] Huang, Z., et al. VBench: Comprehensive Benchmark for Video Generative Models. *CVPR 2024*.
[11] Jacob, B., et al. Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference. *CVPR 2018*.
[12] Labrèche, L., et al. Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. *arxiv preprint 2311.15127*, 2023.
[13] Li, X., et al. Q-Diffusion: Quantizing Diffusion Models. *ICCV 2023*.
[14] Lin, J., et al. AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration. *MLSys 2024*.
[15] Ma, S., et al. HiFloat4: 4-bit Floating-Point Quantization for Deep Neural Networks. *arxiv preprint 2410.10123*, 2024.
[16] Nagel, M., et al. Up or Down? Adaptive Rounding for Post-Training Quantization. *ICML 2020*.
[17] Peebles, W., et al. Scalable Diffusion Models with Transformers. *ICCV 2023*.
[18] Rombach, R., et al. High-Resolution Image Synthesis with Latent Diffusion Models. *CVPR 2022*.
[19] Shang, Y., et al. PTQ4DM: Post-Training Quantization for Diffusion Models. *CVPR 2023*.
[20] Singer, U., et al. Make-A-Video: Text-to-Video Generation without Text-Video Data. *ICLR 2023*.
[21] Team, W., et al. Wan: Open and Advanced Text-to-Video and Image-to-Video Generation. *arxiv preprint 2504.20255*, 2025.
[22] Wan Team. Wan2.2 Technical Report. *arxiv preprint 2504.20255*, 2025.
[23] Wu, Z., et al. PTQ4DiT: Post-Training Quantization for Diffusion Transformers. *arxiv preprint 2410.02421*, 2024.
[24] Xiao, G., et al. SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models. *ICML 2023*.
[25] Yao, Z., et al. ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers. *NeurIPS 2022*.
[26] Yuan, Z., et al. ViDiT-Q: Efficient Post-Training Quantization of Diffusion Transformers for Video Generation. *arxiv preprint 2503.10591*, 2025.
[27] Zhang, Y., et al. ViDiT-Q: Efficient Post-Training Quantization of Diffusion Transformers for Video Generation. *arxiv preprint 2503.10591*, 2025.相似文章
FourTune:迈向扩散模型全4比特高效后训练
FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。
HiFloat4格式:用于大型语言模型端到端强化学习后训练
本文提出了HiFloat4格式和Rollout-ResQ,用于LLM的端到端FP4强化学习后训练,在Qwen2.5模型上实现了与BF16相比仅1.1%的准确率差距。
FAIR-Calib:面向扩散大语言模型训练后量化的前沿感知不稳定性重加权校准
本文提出了FAIR-Calib,一种用于扩散大语言模型的两阶段训练后量化框架,解决了迭代精炼过程中令牌提交的不稳定性问题。在低比特量化下,它在LLaDA和Dream模型上取得了最先进的结果。
面向近无损HiF8 W8A8量化感知训练的最大窗口缩放估计
本文系统研究了OpenPangu-Embedded-1B的HiF8 W8A8量化感知训练,识别并解决了amax饱和和灾难性遗忘等失效模式,通过64步最大算法DTS策略和500步BF16预热实现了近无损性能。
Qift: 移位友好的无零点W2训练后量化,用于旋转W2A4/KV4大语言模型推理
本文介绍了Qift,一种固定的无零点两位权重量化层级集,专为Hadamard旋转的大语言模型设计,通过利用旋转权重的近零中心高斯类分布,实现了改进的W2A4/KV4推理。在LLaMA-2-7B和LLaMA-3.1-8B上的实验显示,相比于标准W2量化,困惑度持续提升。