HiFloat4格式:用于大型语言模型端到端强化学习后训练

arXiv cs.LG 论文

摘要

本文提出了HiFloat4格式和Rollout-ResQ,用于LLM的端到端FP4强化学习后训练,在Qwen2.5模型上实现了与BF16相比仅1.1%的准确率差距。

arXiv:2607.26515v1 公告类型: 新 摘要:据我们所知,我们首次提出了端到端的FP4强化学习后训练,其中 rollout 和训练策略(包括其前向和后向传播)均以4位精度运行。一项系统性研究表明,FP4强化学习性能下降的主要来源并非训练侧的量化误差,而是 rollout 激活量化:异常值极大地扩展了动态范围,导致大量激活值在FP4下下溢为零。反直觉的是,将训练策略恢复为更高精度而保持 rollout 为FP4,其准确性反而比纯FP4基线更差,这暴露了 rollout-训练不匹配是主要的失效模式,并排除了标准的预训练式修复方法。我们通过 Rollout 残差量化(Rollout-ResQ)解决了这一问题:一个单一的残差修正项,受限于硬件友好的稀疏模式,仅添加到FP4 rollout 的矩阵乘法中——这是一种轻量级的修正,能够恢复大部分因异常值驱动的下溢而损失的精度,而不会增加 rollout 的计算开销。在Qwen2.5-3B和Qwen2.5-Math-7B模型上,Rollout-ResQ与HiFloat4(HiF4)格式结合使用——HiF4的三级分层缩放机制在FP4严格的4位预算下保持了分辨率——将准确率差距从4.9%缩小到1.1%,使得完全量化的FP4强化学习与全精度之间的差距大大缩小。将该方法应用于开放标准的MXFP4,同一方案将差距从13.6%缩小到5.3%,揭示了FP4格式的选择是决定可恢复准确率上限的关键因素。这些结果共同确立了HiF4作为端到端FP4强化学习后训练的使能格式,以及Rollout-ResQ作为激活侧机制,使得与BF16的差距得以弥合。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# HiFloat4 格式用于大语言模型的端到端强化学习后训练
来源:https://arxiv.org/html/2607.26515
&何一麦 &Shadan Golestan &Hoang Le11footnotemark:1 &Mehran Taghian11footnotemark:1 &彭云科 &王耀远 &王瑶 &王俊松 &胡天驰 &何丰辰 &胡桂鹏 &Tanzila Rahman &Anandharaju Durai Raju 华为 \{hei\.yi\.mak1, pengyunke\}@huawei\.com

###### 摘要

据我们所知,我们首次提出了*端到端*的FP4强化学习后训练,其中推出策略和训练策略(包括其前向和后向传播)均以4位精度运行。一项系统性研究表明,FP4强化学习中性能下降的主要来源并非训练侧的量化误差,而是推出阶段的激活量化:异常值将动态范围拉得过宽,导致大量激活值在FP4下下溢为零。与直觉相反,将训练策略恢复到更高精度而保持推出策略为FP4,其准确率比完全FP4基线更差,这揭示了推出与训练之间的不匹配是主要的失效模式,并排除了标准预训练式的修复方法。我们通过**推出残差量化**(Rollout-ResQ)来解决这一问题:一个单一的残差校正项,约束为硬件友好的稀疏模式,仅添加到FP4推出的矩阵乘法中——这是一种轻量级的校正,能够恢复因异常值驱动的下溢而丢失的大部分精度,且不会增加推出的计算开销。在Qwen2.5-3B和Qwen2.5-Math-7B上,Rollout-ResQ结合HiFloat4(HiF4)格式——其三级层次化缩放方案在FP4紧张的4位预算下保持了分辨率——将准确率差距从4.9%缩小到1.1%,使得完全量化的FP4强化学习接近全精度水平。应用于开放标准MXFP4时,相同的方案将差距从13.6%缩小到5.3%,这表明FP4格式的选择是决定可恢复准确率上限的关键因素。这些结果共同确立了HiF4作为端到端FP4强化学习后训练的赋能格式,而Rollout-ResQ作为激活侧的机制,使得与BF16的差距变得可弥合。

## 1 引言

大语言模型(LLM)在广泛的应用中取得了显著性能[5 (https://arxiv.org/html/2607.26515#bib.bib5),41 (https://arxiv.org/html/2607.26515#bib.bib41),24 (https://arxiv.org/html/2607.26515#bib.bib24)]。通过利用广泛的思维链推理,LLM在具有挑战性的领域[52 (https://arxiv.org/html/2607.26515#bib.bib52),66 (https://arxiv.org/html/2607.26515#bib.bib66)]中展现了强大能力,例如数学问题求解[12 (https://arxiv.org/html/2607.26515#bib.bib12)]、代码生成[65 (https://arxiv.org/html/2607.26515#bib.bib65)]和智能体工作流[53 (https://arxiv.org/html/2607.26515#bib.bib53),4 (https://arxiv.org/html/2607.26515#bib.bib4)]。在此过程中,这些模型生成了交错探索、验证和自校正的长推理轨迹。大规模激发此类行为推动了强化学习在LLM后训练中的广泛采用[27 (https://arxiv.org/html/2607.26515#bib.bib27),63 (https://arxiv.org/html/2607.26515#bib.bib63),32 (https://arxiv.org/html/2607.26515#bib.bib32),57 (https://arxiv.org/html/2607.26515#bib.bib57)],最显著的形式是使用可验证奖励的强化学习(RLVR),采用策略梯度算法如组相对策略优化(GRPO)[46 (https://arxiv.org/html/2607.26515#bib.bib46)]及其变体[62 (https://arxiv.org/html/2607.26515#bib.bib62),35 (https://arxiv.org/html/2607.26515#bib.bib35),31 (https://arxiv.org/html/2607.26515#bib.bib31)]。

尽管取得了成功,强化学习后训练仍会带来巨大的计算、内存和成本开销[18 (https://arxiv.org/html/2607.26515#bib.bib18),27 (https://arxiv.org/html/2607.26515#bib.bib27),48 (https://arxiv.org/html/2607.26515#bib.bib48)]。每次迭代包含两个阶段:**推出阶段**,其中**推出策略**为每个提示采样响应;**训练阶段**,其中**训练策略**评估这些响应并进行更新。推出阶段通常是主要的瓶颈,因为响应必须在长地平线上自回归采样[27 (https://arxiv.org/html/2607.26515#bib.bib27),54 (https://arxiv.org/html/2607.26515#bib.bib54),15 (https://arxiv.org/html/2607.26515#bib.bib15)]——这一成本在推理任务中被放大,因为更长的轨迹提供了更强的学习信号[54 (https://arxiv.org/html/2607.26515#bib.bib54)]。一种自然的解决方案是低精度计算,特别是量化[8 (https://arxiv.org/html/2607.26515#bib.bib8)],它减少了内存使用并加速了主导生成和前向/后向传播的矩阵乘法。量化推出策略解决了这一瓶颈,但量化训练策略对于端到端效率同样重要[54 (https://arxiv.org/html/2607.26515#bib.bib54)]:除了加速前向和后向传播外,它还缩小了两种策略之间的数值不匹配,从而产生更稳定的后训练。

为了提高强化学习后训练的效率,先前的工作探索了使用8位格式(如FP8或INT8)的低精度计算,要么仅应用于推出策略[26 (https://arxiv.org/html/2607.26515#bib.bib26)],要么同时应用于推出和训练策略[54 (https://arxiv.org/html/2607.26515#bib.bib54)]。这些方法中的一个核心问题是量化后的推出策略与更高精度训练策略之间的数值不匹配,他们通过重要性采样校正[26 (https://arxiv.org/html/2607.26515#bib.bib26)]或统一的低精度流水线[54 (https://arxiv.org/html/2607.26515#bib.bib54)]来解决。最近,QeRL[20 (https://arxiv.org/html/2607.26515#bib.bib20)]将推出策略推进到4位(NVFP4),同时通过LoRA适配器保持梯度为更高精度,证明了4位推出在不破坏训练稳定性的情况下是可行的。这些结果共同表明,降低精度可以显著加速训练并降低内存开销。在这项工作中,我们更进一步,研究**端到端**的FP4强化学习后训练,其中推出和训练策略——包括它们的前向和后向传播——都以4位运行。这一体制比上述设置更具挑战性:与QeRL不同,我们未保留更高精度的梯度路径;与8位方法不同,我们运行的精度水平下,有限的数值范围和分辨率可能破坏优化,导致脆弱且往往不收敛的训练动态。

我们基于HiFloat4(HiF4)[36 (https://arxiv.org/html/2607.26515#bib.bib36)],它使用三级层次化缩放方案来扩展动态范围,同时在FP4紧张的4位预算内保持分辨率。我们还评估了MXFP4[44 (https://arxiv.org/html/2607.26515#bib.bib44)],这是一种每块单一共享尺度的开放标准4位格式,以测试我们的发现是否特定依赖于HiF4。先前的工作[49 (https://arxiv.org/html/2607.26515#bib.bib49)]表明,HiF4能够实现完全量化的FP4预训练,仅在训练过程中使用最小的精度恢复技术,就能匹配全精度基线。然而,强化学习后训练改变了困难所在,预训练方案是否能够迁移——如果不能,新的困难在哪里——是我们接下来要解决的问题。

我们通过系统研究FP4强化学习后训练中精度真正重要的位置来回答这个问题。我们将性能下降的主要来源定位到推出侧的**激活**量化,而非训练侧的量化。令人惊讶的是,将训练策略恢复到更高精度而保持推出策略为FP4,不仅无法恢复准确率,反而比完全FP4训练表现更差,这表明推出与训练之间的不匹配(而非训练侧的噪声)是主要的失效模式。为了理解推出侧的问题,我们检查了激活分布,发现异常值将动态范围拉得如此之宽,以至于大量激活值在FP4下下溢为零。初步实验表明,将推出激活保持在更高精度表示中可以恢复相对于基线损失的大部分准确率——但这种修复放弃了我们本想捕捉的好处,因为混合精度GEMM(更高精度的激活×FP4权重)放弃了真正FP4矩阵乘法的吞吐量。

一个自然的下一步是借鉴后训练量化(PTQ)文献,该文献已开发出处理激活异常值的丰富工具:平滑[55 (https://arxiv.org/html/2607.26515#bib.bib55)]、缩放[29 (https://arxiv.org/html/2607.26515#bib.bib29)]、裁剪[51 (https://arxiv.org/html/2607.26515#bib.bib51)]、可学习的校准变换[45 (https://arxiv.org/html/2607.26515#bib.bib45)],以及基于旋转或排列的方法[3 (https://arxiv.org/html/2607.26515#bib.bib3),33 (https://arxiv.org/html/2607.26515#bib.bib33),28 (https://arxiv.org/html/2607.26515#bib.bib28)]。然而,这些方法都假设**静态**推理设置:激活统计量在验证集上估计一次,量化参数离线拟合,得到的变换在部署时不变地重复使用。强化学习后训练违反了所有这些假设。随着策略更新,推出分布——以及随后的激活统计量——会不断变化,因此在步骤t完成的任何校准到步骤t+1时已部分过时,频繁重新校准以跟踪这种漂移将侵蚀最初促使FP4的效率增益。因此,我们采取了不同的路线,采用了一种受[64 (https://arxiv.org/html/2607.26515#bib.bib64)]启发的逐张量回退机制,其中异常值从激活张量中分离出来,形成两个FP4张量,以充分利用低精度GEMM。这恢复了与BF16基线的大部分差距,并且与更高精度激活替代方案不同,它保持推出过程在4位端到端。但问题是,将激活拆分为两个FP4张量会使推出的FP4 GEMM数量加倍,将一种低效率形式变为另一种。

为了消除这一开销同时保持准确率提升,我们提出了**推出残差量化**(Rollout-ResQ),它在标准FP4推出计算中增加了一个残差校正项,该校正项被约束为硬件友好的稀疏模式[40 (https://arxiv.org/html/2607.26515#bib.bib40)]。这两个要素不可分割:残差受[64 (https://arxiv.org/html/2607.26515#bib.bib64)]分解的启发,捕获了标准FP4推出所导致的异常值驱动误差;而施加的稀疏性确保了校正本身的运行成本仅为密集FP4 GEMM的一小部分。结果是一个单个轻量级校正,添加到FP4推出路径中——在保持准确率接近更高精度激活替代方案的同时,保留了真正的FP4 GEMM端到端吞吐量。我们的贡献如下:

- **首次端到端FP4强化学习后训练**。据我们所知,我们提出了首个端到端FP4强化学习后训练,其中推出和训练策略——包括它们的前向和后向传播——均以4位精度运行,无需LoRA适配器或更高精度的梯度路径。
- **诊断**。我们将性能下降的主要来源定位到推出侧的**激活**量化,其中异常值导致大部分激活值在FP4下下溢。仅将训练策略恢复到更高精度,其表现比统一FP4训练更差,表明推出与训练之间的不匹配(而非训练侧噪声)是主要的失效模式。
- **Rollout-ResQ**。一个带有硬件友好稀疏模式的单一残差校正项,添加到FP4推出的矩阵乘法中。该校正恢复了因异常值驱动下溢而损失的大部分准确率,同时保持推出路径为FP4 GEMM。
- **结果**。在Qwen2.5-3B和Qwen2.5-Math-7B上,Rollout-ResQ结合HiF4将BF16准确率差距从4.9%缩小到1.1%;结合MXFP4时,从13.6%缩小到5.3%。该方法与格式无关,而HiF4是极端精度训练中更优的格式。

## 2 相关工作

#### 强化学习的量化感知训练(QAT)。

先前针对低精度强化学习后训练的QAT方法主要将问题框架化为训练-推出策略不匹配,因为推出策略被量化(例如FP8),而训练策略保持更高精度(例如BF16),并通过截断的重要性采样[59 (https://arxiv.org/html/2607.26515#bib.bib59),30 (https://arxiv.org/html/2607.26515#bib.bib30)]、自适应量化噪声[20 (https://arxiv.org/html/2607.26515#bib.bib20)]、自适应裁剪和更新感知量化[26 (https://arxiv.org/html/2607.26515#bib.bib26)]来解决这一问题。JetRL[54 (https://arxiv.org/html/2607.26515#bib.bib54)]通过实施跨两个策略的统一低精度流水线来消除不匹配。然而,这些方法都没有考虑到推出激活量化的特定挑战,而我们的结果将其确定为关键瓶颈。

#### 基于缩放的方法。

大量工作通过混合精度保护[10 (https://arxiv.org/html/2607.26515#bib.bib10),25 (https://arxiv.org/html/2607.26515#bib.bib25),23 (https://arxiv.org/html/2607.26515#bib.bib23),11 (https://arxiv.org/html/2607.26515#bib.bib11)]来解决低精度量化中的异常值问题,即保留一小部分显著通道或权重的更高精度以减少量化误差。AWQ[29 (https://arxiv.org/html/2607.26515#bib.bib29)]使用激活感知缩放来保护显著权重通道,SmoothQuant[55 (https://arxiv.org/html/2607.26515#bib.bib55)]通过等效变换将量化难度从激活迁移到权重,而OmniQuant[45 (https://arxiv.org/html/2607.26515#bib.bib45)]进一步引入了可学习的权重裁剪和等效变换。所有这些方法都假设模型已冻结并具有离线校准数据,这使得它们不适合强化学习后训练,因为激活统计量会随着策略演变而不断变化。

#### 基于旋转的方法。

QuaRot[3 (https://arxiv.org/html/2607.26515#bib.bib3)]、SpinQuant[33 (https://arxiv.org/html/2607.26515#bib.bib33)]、DuQuant[28 (https://arxiv.org/html/2607.26515#bib.bib28)]和[50 (https://arxiv.org/html/2607.26515#bib.bib50)]通过旋转或随机Hadamard变换(RHT)将极端激活值重新分布到各通道,以简化量化。与基于缩放的方法类似,这些变换通常针对冻结模型固定或离线优化,不太适用于强化学习后训练中不断演变的策略和非独立同分布的推出分布。

#### 基于残差的方法。

ARCQuant[39 (https://arxiv.org/html/2607.26515#bib.bib39)]通过增强残差通道补偿量化误差,假设静态设置,其中激活统计量可以一次性估计。[51 (https://arxiv.org/html/2607.26515#bib.bib51)]通过异常值裁剪与补偿(OCC)策略缓解激活崩溃,该方法不需要离线校准,因此更适用于强化学习后训练。[64 (https://arxiv.org/html/2607.26515#bib.bib64)]提出了一种动态块级回退方法,用量化激活补充一个重

相似文章

Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化

arXiv cs.AI

本文介绍了Tail-Aware HiFloat4,这是一种针对Wan2.2文本到视频扩散模型的W4A4训练后量化方法,该方法采用激活尾感知百分位校准来缓解异常值的影响,同时保持HiFloat4算术运算不变。

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。