FourTune:迈向扩散模型全4比特高效后训练

arXiv cs.LG 论文

摘要

FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。

arXiv:2607.05711v1 公告类型:新 摘要:扩散模型已成为高质量生成建模的主导范式,而后训练对于将其适应多样化的下游应用至关重要。然而,大型扩散模型的后训练仍然具有挑战性,因为其巨大的内存占用和缓慢的训练速度,现有的参数高效微调方法只能部分解决这些问题。为了克服这些限制,我们提出了FourTune,一个基于端到端W4A4G4范式的扩散模型高效后训练框架。FourTune引入了一个三分支混合流水线,通过一个冻结的数值稳定器增强标准LoRA架构,以隔离量化敏感的异常值,从而在原生4比特计算下实现稳定训练。此外,FourTune采用硬件高效的块级量化和自定义融合内核,以支持高效的量化反向传播并减少内存带宽开销。在定制化、强化学习和蒸馏任务中,FourTune达到了与全精度微调相当的质量。在FLUX.1-dev(12B)上,与BF16 LoRA相比,FourTune将内存开销降低了2.25倍,并将端到端训练吞吐量提升了2.27倍。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:44

# FourTune: 迈向扩散模型的全4位高效后训练

来源:https://arxiv.org/html/2607.05711

Zihan MinXingyang LiZhekai ZhangHaocheng XiLvmin ZhangManeesh AgrawalaJun-Yan ZhuSong HanYujun LinMuyang Li

###### 摘要

扩散模型已成为高质量生成建模的主导范式,而后训练对于将其适应多样化的下游应用至关重要。然而,大型扩散模型的后训练由于高昂的内存占用和缓慢的训练速度仍具挑战性,现有的参数高效微调方法仅能部分解决这些问题。为了克服这些限制,我们提出了 **FourTune**,一种基于端到端 **W4A4G4** 范式的扩散模型高效后训练框架。FourTune 引入了一种三分支混合流水线,在标准 LoRA 架构上增加了一个冻结的数值稳定器,以隔离对量化敏感的离群值,从而在原生 4 位计算下实现稳定训练。此外,FourTune 采用硬件高效的块级量化和定制化融合内核,以支持高效的量化反向传播并减少内存带宽开销。在定制化、强化学习和蒸馏任务上,FourTune 达到了与全精度微调相当的质量。在 FLUX.1-dev(12B)上,与 BF16 LoRA 相比,FourTune 的内存开销减少了 **2.25×**,端到端训练吞吐量提升了 **2.27×**。

![[无标题图片]](https://arxiv.org/html/2607.05711v1/x1.png)

图1:FourTune 与基线的定性和定量对比。**上**:三个不同后训练任务(定制化、强化学习、蒸馏)的视觉对比。尽管采用极低比特量化(W4A4G4),FourTune 生成的高保真图像在全精度 BF16 LoRA 基线面前几乎无法区分。**下**:在 FLUX.1-dev(1024×1024)上进行的效率基准测试。(a) FourTune 将 GPU 内存消耗相比 BF16 LoRA 减少了 **2.25×**,实现了与 NF4 QLoRA 相当的紧凑占用空间。(b) 在训练速度方面,FourTune 显著优于现有方法,相比 BF16 LoRA 和 NF4 QLoRA 分别实现了 **2.27×** 和 **2.79×** 的加速,有效打破了大型模型后训练中的内存-速度权衡。

## 1 引言

参见图注图2:不同 PEFT 方法的前向和反向流水线对比。(a) LoRA 遵循标准的高精度训练流水线,权重 \(W\)、激活 \(A\) 和梯度 \(G\) 均以高精度存储和计算。(b) QLoRA 通过将权重以 4 位精度存储来减少内存占用,但仍需在计算时在线反量化至 16 位(W4A16G16)。(c) 我们的 FourTune 将权重、激活和梯度全部量化为 4 位(W4A4G4),在保持内存效率的同时,实现了前向和反向传递的低比特计算。生成模型在合成高保真且语义复杂的内容方面已展现出卓越能力(Black Forest Labs, 2024 (https://arxiv.org/html/2607.05711#bib.bib7); Qwen Team, 2025 (https://arxiv.org/html/2607.05711#bib.bib8))。为了追求更高的生成质量,研究社区不断放大模型规模以释放更大潜力,见证了参数的爆炸式增长。模型大小已从 860M 参数的 SD1.5(Rombach et al., 2022 (https://arxiv.org/html/2607.05711#bib.bib1)),增长到基于 DiT 的 12B FLUX.1(Black Forest Labs, 2024 (https://arxiv.org/html/2607.05711#bib.bib7)),再到最近的 20B 参数 Qwen-Image(Qwen Team, 2025 (https://arxiv.org/html/2607.05711#bib.bib8))。然而,这种快速扩展显著提高了训练和部署的计算要求,使得在消费级 GPU 上运行此类模型变得越来越困难。尽管先进的量化方法(Li et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib58), 2023 (https://arxiv.org/html/2607.05711#bib.bib56); Shang et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib57))通过低比特量化降低了推理门槛,但后训练中的资源瓶颈仍未得到充分解决。

关键的是,后训练是通向模型实用化和个性化的重要途径。具体来说,通过定制化,模型可以学习特定的角色、风格或概念(Kumari et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib16); Ruiz et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib17));通过强化学习,模型可以与人类审美偏好对齐(Fei et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib24); Shen et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib23));而通过蒸馏,扩散模型的推理步骤可以显著减少,以节省部署成本(Chen et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib36); Frans et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib35))。然而,扩散模型后训练的计算和内存需求仍然高得令人望而却步。因此,实现计算高效且内存友好的后训练已成为一个关键问题。

最近的参数高效微调(PEFT)方法通过大幅减少可训练参数和计算成本,同时实现与全参数微调相当的性能,而越来越受欢迎(Schulman and Thinking Machines Lab, 2025 (https://arxiv.org/html/2607.05711#bib.bib55))。然而,尽管取得了这些进展,现有的 PEFT 方法尚未转化为进一步的实际效率提升,因为它们从根本上仍受制于持久的内存-速度权衡。例如,LoRA(Hu et al., 2022 (https://arxiv.org/html/2607.05711#bib.bib50))(图2 (https://arxiv.org/html/2607.05711#S1.F2)(a))通过最小化可训练参数数量来减少训练开销。然而,全精度的骨干权重仍然占用大量 GPU 内存。为了缓解这一瓶颈,QLoRA(Dettmers et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib61))(图2 (https://arxiv.org/html/2607.05711#S1.F2)(b))通过量化基座模型权重来减少内存使用。但它并未降低计算成本,而且频繁的在线反量化甚至可能带来额外的计算开销。总之,一个自然的问题出现了:是否有可能超越 LoRA 进一步加速后训练?

为了解决这一挑战,我们提出了 **FourTune**,一个全 4 位后训练框架,旨在打破现有的效率瓶颈。与 QLoRA 等仅量化权重的方法不同,FourTune 采用完全量化的骨干,对权重、激活和梯度使用 4 位精度(W4A4G4)(图2 (https://arxiv.org/html/2607.05711#S1.F2)(c))。据我们所知,FourTune 是首个面向大型生成模型的权重、激活和梯度的全 4 位后训练框架。我们在标准 LoRA 微调框架之上引入了一个数值稳定器,以确保在极低比特量化机制下训练稳定且收敛。我们还采用块级量化,实现了高效的在线转置以直接进行 4 位反向传播,消除了转置和反量化开销。此外,我们提出了定制化的内核融合方案,分别作用于 LoRA 模块和 MLP 模块,以最小化内存访问开销。这种协同设计既减少了计算负载和内存占用,达到了与 QLoRA 相当的内存使用量,同时又超越了全精度 LoRA 微调的训练速度。

我们在定制化、强化学习和蒸馏任务上进行了广泛实验,结果表明 **FourTune** 能够实现扩散模型的高效后训练,同时保持与全精度微调相当的生成质量。与 BF16 LoRA 训练相比,FourTune 将内存占用降低了高达 **2.25×**,并将训练速度提升了高达 **2.27×**。总体而言,FourTune 弥合了扩散模型后训练中高效率与高性能之间的鸿沟。

## 2 相关工作

### 2.1 扩散模型的后训练

随着扩散模型规模的扩大(Podell et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib2); Black Forest Labs, 2024 (https://arxiv.org/html/2607.05711#bib.bib7); Qwen Team, 2025 (https://arxiv.org/html/2607.05711#bib.bib8); Wan Team, 2025 (https://arxiv.org/html/2607.05711#bib.bib12)),后训练已成为大型扩散模型下游适应性的关键阶段。这一阶段通常包括定制化、强化学习和蒸馏。

定制化使模型能够从特定的身份、风格或主体中学习新概念,同时保留原始的生成保真度(Kumari et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib16); Ruiz et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib17); Gal et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib18))。强化学习通过在线 RL(Clark et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib19); Prabhudesai et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib20), 2024 (https://arxiv.org/html/2607.05711#bib.bib21))将人类偏好融入训练,对可微分奖励进行直接梯度更新,以及基于策略的方法(Black et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib25); Fan and Lee, 2023 (https://arxiv.org/html/2607.05711#bib.bib26); Fan et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib27))。蒸馏将多步去噪压缩为高效的少步生成,采用的方法包括轨迹回归(Luhman and Luhman, 2021 (https://arxiv.org/html/2607.05711#bib.bib31); Salimans et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib32); Liu et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib33))、一致性建模(Song et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib37); Gu et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib38); Kim et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib39))和分布匹配(Yin et al., 2024b (https://arxiv.org/html/2607.05711#bib.bib43), a (https://arxiv.org/html/2607.05711#bib.bib44); Sauer et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib45))。

### 2.2 参数高效适配

参数高效微调(PEFT)已成为全参数微调的标准替代方案,其动机来自大型模型中的适应性通常位于低内在维度的观察(Aghajanyan et al., 2021 (https://arxiv.org/html/2607.05711#bib.bib79))。在 PEFT 方法中,低秩适配(LoRA)及其变体(Hu et al., 2022 (https://arxiv.org/html/2607.05711#bib.bib50); Soboleva et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib51); Zhang et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib52); Liu et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib54))在语言模型和扩散模型中(Schulman et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib55); YEH et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib76); Chen et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib36))都特别有效,因为它们引入低秩更新矩阵,同时保持预训练权重冻结,从而避免了基于适配器的方法(Houlsby et al., 2019 (https://arxiv.org/html/2607.05711#bib.bib80))带来的额外推理延迟。

为了进一步提高微调效率,QLoRA(Dettmers et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib61))使用 4 位量化的骨干进行 LoRA 训练,显著减少了内存消耗,但代价是增加了在线反量化带来的计算开销。在此基础上,后续工作探索了更好的精度-效率权衡。例如,LoftQ(Li et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib62))通过 LoRA 感知的量化技术解决这一问题,而 QA-LoRA(Xu et al., 2024 (https://arxiv.org/html/2607.05711#bib.bib63))通过向量化基座模型整合额外权重来减少辅助开销。

### 2.3 模型量化

量化通过将全精度权重 W\boldsymbol{W} 映射到低比特表示来减少内存和计算,通常通过 W~=Round(W/s)\tilde{\boldsymbol{W}}=\mathrm{Round}(\boldsymbol{W}/s) 并配合缩放因子 s 实现。诸如 NF4 和硬件感知的浮点方案(例如 MXFP4 和 NVFP4)等现代格式采用组级缩放,以更好地保留当前加速器上的数值保真度(Dettmers et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib61); Rouhani et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib75); NVIDIA, 2024 (https://arxiv.org/html/2607.05711#bib.bib74))。

先前的研究表明,扩散模型可以有效地压缩到 8 位或 4 位精度以进行高效推理(Li et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib56); Shang et al., 2023 (https://arxiv.org/html/2607.05711#bib.bib57); Li et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib58))。更近期的研究将量化扩展到训练,包括直接以 4 位精度(NVFP4)预训练大型语言模型(NVIDIA, 2025 (https://arxiv.org/html/2607.05711#bib.bib59))。量化也已与参数高效适配相结合。例如,QeRL(Huang et al., 2025 (https://arxiv.org/html/2607.05711#bib.bib60))将 NVFP4 与 LoRA 集成,并在强化学习设置中展示了改进的探索能力。

参见图注图3:FourTune 框架概述。(a) **权重量化**:通过 SVD 将高精度权重分解为量化友好的 4 位残差和高精度稳定器。(b) **三分支流水线**:该架构由一个用于算术效率的冻结 4 位骨干、一个用于确保数值精度的冻结稳定器,以及一个用于任务适配的可训练 LoRA 分支组成。

## 3 方法

我们提出 FourTune,一个为大型生成模型建立原生 4 位流水线的后训练框架(图3 (https://arxiv.org/html/2607.05711#S2.F3))。我们的方法将权重、激活和梯度量化为 4 位,并直接以 4 位执行骨干矩阵乘法。这种设计最大限度地提高了算术效率,同时显著减少了内存占用。在本节中,我们描述了由一个小型全精度稳定器分支支持的整体 4 位训练流水线、一种能够在反向传播期间实现高效转置的块级量化策略,以及提高内存带宽利用率的定制化内核融合方案。

### 3.1 三分支混合精度流水线

直接在激进量化(例如 4 位)的权重上执行前向和反向传播通常数值不稳定,这是由于动态范围有限以及权重、激活和梯度中存在大幅离群值。为了解决这一挑战,我们提出了一种**三分支混合精度流水线**,该流水线明确地将数值稳定化与任务适配解耦。

我们的方法引入了一个额外的**低秩、全精度稳定器分支**,以显式处理对量化敏感的离群值,并提高训练期间的数值稳定性。具体而言,在分离出稳定器组件后,剩余的冻结骨干权重使用硬件友好的低比特浮点格式(NVFP4)进行量化,以利用 GPU 上强大的 4 位计算单元。

形式上,基于谱分解,我们...

相似文章

Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化

arXiv cs.AI

本文介绍了Tail-Aware HiFloat4,这是一种针对Wan2.2文本到视频扩散模型的W4A4训练后量化方法,该方法采用激活尾感知百分位校准来缓解异常值的影响,同时保持HiFloat4算术运算不变。

基于平坦度的理论最优量化

arXiv cs.LG

介绍了平坦度度量与双向对角量化(BDQ)用于大型语言模型的训练后量化,实现了接近无损的4比特权重和激活量化,并在极低比特设置下取得了显著改进。