CurveFP:用于语言模型的具有闭合乘积的有理基数对数数据类型
摘要
提出了 CurveFP,一种闭合乘积码本族,将量化幅度分布在交叉对数曲线上,实现精确的符号异或和整数索引更新。它以七位推理达到 FP8 类行为,并在 7B-9B 模型上改善了困惑度。
arXiv:2608.10010v1 公告类型:新
摘要:低精度数据类型降低了语言模型成本,但大多数格式在优化标量保真度的同时,其乘积引起的算术运算保持不变。我们引入了 CurveFP,一种闭合乘积码本族,它将量化幅度分布在紧凑块尺度下的交叉对数曲线上。有理基数在局部分辨率之间调整动态范围,而均匀曲线索引使每个非零乘积在代数上闭合。乘积的形成变为精确的符号异或和整数索引更新,并且导出的有限相位计数决定了累加调度。我们将此代数实例化为用于训练的 CurveFP 八位 E4C3/E5C2 和用于紧凑部署的 CurveFP 七位 E3C3。在评估中,CurveFP 七位在四个 7B-9B 模型上以少一个元素位的代价优于张量级 FP8 困惑度,并保持在原生质量的 1.32\% 以内。CurveFP 八位在所有 36 组成对的前向和反向 GEMM 比较中降低了操作数 NMSE。在三个匹配的 128.3M 参数三元组中,每种模式每个种子完成 3B 令牌预训练;CurveFP 八位达到平均 BF16 推理困惑度 22.5366,而 FP8 为 22.5407,并且在所有三个种子中产生更低的格式引起的惩罚。一个 36 单元的下游矩阵在全部 12 个种子格式比较中发现,经过 CurveFP 八位训练的检查点在 WikiText-103 上的困惑度更低,而 PG-19 和任务差异则混合。总之,这些结果确立了 CurveFP 作为一种算术协同设计,结合了 FP8 类数值行为、七位推理和更简单的乘积路径。
查看缓存全文
缓存时间: 2026/08/12 08:27
# 具有闭合乘积的有理基数对数数据类型,用于语言模型
来源:https://arxiv.org/html/2608.10010
Ye Qiao 加州大学欧文分校电气工程与计算机科学系 美国加州尔湾
###### 摘要
低精度数据类型可降低语言模型成本,但大多数格式只优化标量保真度,而由其乘积所引发的算术却保持不变。我们提出CurveFP,这是一个闭合乘积码本族,在紧凑的块缩放下,将量化幅值分布到交错的对数曲线上。有理基数在动态范围与局部分辨率之间进行调节,而均匀的曲线索引使得每个非零乘积在代数上完全闭合。乘积的形成变为精确的符号异或和整数索引更新,并且推导出的有限相位计数决定了累加调度。我们将这一代数实例化为用于训练的CurveFP8E4C3/E5C2和用于紧凑部署的CurveFP7E3C3。在评估中,CurveFP7在四个7B–9B模型上以少一个元素比特的张量级FP8困惑度,并且与原生质量的差距在1.32%以内。CurveFP8在所有36个成对的前向和反向GEMM比较中降低了操作数NMSE。在三个匹配的128.3M参数三元组中,每种模式均完成每随机种子的3B token预训练;CurveFP8达到平均BF16推理困惑度22.5366,而FP8为22.5407,并且在全部三个随机种子中产生更低的格式引入惩罚。一个36格子的下游矩阵发现,在所有12个种子-格式比较中,CurveFP8训练的检查点在WikiText-103上困惑度更低,PG-19和任务差值则各有优劣。这些结果共同确立CurveFP为一种算术协同设计,它结合了FP8级别的数值行为、七比特推理以及一条显著更简单的乘积路径。
## 1 引言
低精度算术已成为扩展语言模型训练和推理的主要杠杆,然而主流数据类型优化的是单个值的近似方式,同时在很大程度上接受了它们所引发的乘积成本。FP8确立了特定角色的指数和尾数布局能够匹配16位训练质量(Micikevicius等人,2022 (https://arxiv.org/html/2608.10010#bib.bib1));随后,微缩放格式通过逐块缩放分摊了范围(Rouhani等人,2023 (https://arxiv.org/html/2608.10010#bib.bib8))。训练后方法从数据侧攻克同样的数值瓶颈,将激活中的异常值移入权重(Xiao等人,2023 (https://arxiv.org/html/2608.10010#bib.bib10))或将其旋转消除(Ashkboos等人,2024 (https://arxiv.org/html/2608.10010#bib.bib11); Liu等人,2025 (https://arxiv.org/html/2608.10010#bib.bib12))。这些进展使量化变得更加精确,但它们的元素乘积仍然需要传统的整数或浮点乘法器。
乘积结构是低精度设计中未被充分利用的效率来源。学习到的乘积/子空间码本提供了灵活的压缩点(Wang等人,2026 (https://arxiv.org/html/2608.10010#bib.bib16); Qiao等人,2026b (https://arxiv.org/html/2608.10010#bib.bib17)),但本身并不施加标量闭合乘积代数。均匀整数简化了累加,但随着激活范围变宽,越来越依赖细粒度的缩放。对数表示使乘法变为加法,但粗糙的2的幂牺牲了局部分辨率,并且仍然需要累加策略(Miyashita等人,2016 (https://arxiv.org/html/2608.10010#bib.bib2))。加性2的幂码通过若干移位-加项恢复更多电平(Li等人,2020 (https://arxiv.org/html/2608.10010#bib.bib13))。这些权衡促使我们提出一个比单纯标量误差更强的目标:联合设计电平几何和乘积代数,使更低的精度同时提升表示密度和算术规则性。
我们用CurveFP来实现这一目标,这是一个块缩放的闭合乘积码本族。如图1 (https://arxiv.org/html/2608.10010#S1.F1)所示,CurveFP将量化幅值分布到KK条交错的对数曲线上。每个非零元素在一个共享的2的幂缩放下存储一个符号、一个二进制补码指数和一个曲线索引。均匀的曲线间距使得乘法在码域中精确成立:符号异或、曲线索引相加以及带进位的指数相加。约简的有理基数r=2p/qr=2^{p/q}在动态范围与局部精度之间进行调整,而推导出的相位计数qK/gcd(p,qK)qK/\gcd(p,qK)则揭示了累加必须组合的分数指数类别的数量。因此,每个范围-分辨率选择都有一个明确的累加契约,并且每个可表示的乘积都落在已知相位上,无需查找、投影或通用的乘积形成乘法器。
参见图注图1:CurveFP协同设计表示和乘法。2的幂缩放提供操作数块范围,而符号、指数和曲线字段对每个元素进行编码。均匀的曲线索引使乘积在异或和整数加法下精确闭合。有理基数产生HH个固定的相位类别;乘积被路由到有符号整数箱中,并使用固定相位权重进行组合。这种映射定义了下面评估的推理和训练格式。一个代数支持两个实用的工作点。CurveFP8在正向权重和激活中使用E4C3,在反向梯度中使用E5C2,直接镜像了FP8 E4M3/E5M2的范围分配,同时用闭合曲线乘积替换尾数乘积。CurveFP7使用E3C3,将部署时的元素宽度减少12.5%,同时保留八个乘积相位。块缩放提供了七比特激活所需的局部范围;紧凑的二进制缩放指数保留了移位-计数累加结构。因此,一个数值族以相同的闭合规则同时覆盖训练和推理。
实证证据表明,这种算术协同设计能够提供FP8级别的模型质量。在Llama-3-8B、Qwen3-8B、Qwen3.5-9B和Falcon-H1-7B上,块缩放的CurveFP7在所有四个模型上以少一个元素比特的方式超越了张量级FP8的困惑度,并且与原生参考的差距在1.32%以内。对于训练,CurveFP8在所有36个成对的前向、激活梯度和权重梯度窗口中均产生比FP8更低的操作数NMSE。最重要的是,三个匹配的128.3M参数实验分别按模式、按随机种子训练BF16、FP8和CurveFP8达3.00B token。所有九个训练通道均无发散地完成。在BF16推理下,CurveFP8的平均困惑度为22.5366,而FP8为22.5407,在三个配对随机种子中赢得两个,并且在全部三个随机种子中具有更低的格式引入惩罚。种子变异支持FP8类训练对等性,而非统计上的优越性。
我们的贡献是:
- •我们提出了一个跨有理基数对数曲线分布的块缩放码本族,使其曲线索引在乘法下精确闭合,并推导出连接表示选择与累加的有限相位计数。
- •我们将一个代数实例化为面向FP8类训练的CurveFP8和面向七比特部署的CurveFP7,它们具有紧凑的2的幂缩放元数据,并且在乘积形成中无需通用乘法器。
- •我们提供了端到端的证据,涵盖四模型推理、有理基数和缩放消融、全部三种训练GEMM、三次匹配的3B token预训练运行,以及一个36格子的OOD/下游格式迁移研究。
## 2 相关工作
#### 低精度数据类型。
FP8将E4M3正向操作数与E5M2梯度结合,以保留训练范围,并已成为主要的八比特浮点基线(Micikevicius等人,2022 (https://arxiv.org/html/2608.10010#bib.bib1))。微缩放通过在一整块窄浮点或整数元素之间共享缩放因子来扩展这种方法(Rouhani等人,2023 (https://arxiv.org/html/2608.10010#bib.bib8));混合块浮点同样在DNN训练期间共享指数,但保留线性有效数(Drumond等人,2018 (https://arxiv.org/html/2608.10010#bib.bib6))。在加速器层面,TeLLMe将三值权重与查找表矩阵乘法耦合,用于边缘FPGA上的端到端LLM预填充和解码(Qiao等人,2026a (https://arxiv.org/html/2608.10010#bib.bib18))。
#### 对数神经网络算术。
经典LNS在对数域中编码标量幅值,使乘法变为加法;神经网络工作已将其应用于量化CNN/LSTM、加速器算术以及具有乘法更新的低精度训练(Miyashita等人,2016 (https://arxiv.org/html/2608.10010#bib.bib2); Kouretas and Paliouras,2018 (https://arxiv.org/html/2608.10010#bib.bib3); Christ等人,2022 (https://arxiv.org/html/2608.10010#bib.bib4); Zhao等人,2022 (https://arxiv.org/html/2608.10010#bib.bib5))。将CurveFP的指数和曲线字段展平为n=Ke+kn=Ke+k,可以得到一个有限的、块缩放的LNS格,这解释了共享的加性乘积代数。CurveFP通过不同的数据类型接口使用这一代数:一个显式的多曲线码本、紧凑的缩放契约、H=qK/gcd(p,qK)H=qK/\gcd(p,qK)相位定律,以及使用常规AdamW训练的特定角色LLM格式。APoT则通过多个移位-加项改进分辨率(Li等人,2020 (https://arxiv.org/html/2608.10010#bib.bib13))。
#### LLM量化与结构化码本。
现代LLM训练后量化通常在应用常规数据类型之前对张量进行重塑。SmoothQuant将激活异常值迁移到权重中(Xiao等人,2023 (https://arxiv.org/html/2608.10010#bib.bib10));QuaRot和SpinQuant使用固定或学习到的旋转来抑制异常值(Ashkboos等人,2024 (https://arxiv.org/html/2608.10010#bib.bib11); Liu等人,2025 (https://arxiv.org/html/2608.10010#bib.bib12))。学习到的表示提供了一条互补的路径:LO-BCQ对块进行聚类,并为每个聚类分配一个优化的标量码本(Elangovan等人,2025 (https://arxiv.org/html/2608.10010#bib.bib14)),而NestQuant使用自相似嵌套格来实现低误差矩阵乘积(Savkin等人,2025 (https://arxiv.org/html/2608.10010#bib.bib15))。这些方法面向激进的W4A4推理,并且可以超越简单的标量格式的精度。乘积/子空间量化遵循另一条路径:APEX-Q允许任意的子向量维度,而FASQ提供免校准的灵活压缩点和定制GPU内核(Wang等人,2026 (https://arxiv.org/html/2608.10010#bib.bib16); Qiao等人,2026b (https://arxiv.org/html/2608.10010#bib.bib17))。我们的目标不同:CurveFP用有理基数和均匀曲线索引参数化其电平,获得一个由推理和训练共享的紧凑闭合乘积代数。这种结构在没有校准时间变换的情况下达到FP8质量区间。
## 3 CurveFP
#### 概述。
CurveFP从一个闭合乘积码本视图出发:将值分布在结构化曲线上,使表示质量和乘积组合同时改善。我们首先定义有理基数元素码,然后推导闭合乘积形成和相位结构化累加,最后为训练和紧凑推理实例化特定角色的格式。
### 3.1 一个有理基数数据类型族
CurveFP用一个2的幂缩放来表示一个张量块,并用符号、指数和曲线索引来表示每个元素。设EE和CC分别表示指数和曲线索引宽度,令K=2CK=2^{C},并选择一个约简的有理基数r=2p/qr=2^{p/q}。块bb中的非零量化值为
x^=(−1)s2abre+k/K,e∈{−2E−1,...,2E−1−1},k∈{0,...,K−1},\widehat{x}=(-1)^{s}2^{a_{b}}r^{e+k/K},\qquad e\in\{-2^{E-1},\ldots,2^{E-1}-1\},\quad k\in\{0,\ldots,K-1\},(1)其中aba_{b}是一个有符号的共享缩放指数。因此,该元素占用1+E+C1+E+C比特。我们保留幅值索引零作为哨兵,并省略最小的非零指数/曲线组合,留下2E+C−12^{E+C}-1个正幅值;超出缩放范围的值映射到端点。与学习到的码本不同,这些电平不需要任意的常数表:相邻的曲线索引相差固定的比率r1/Kr^{1/K},相邻的指数相差rr。
给定aba_{b},量化保留源符号,并选择重构值在绝对误差上最接近的幅值,在端点处饱和。静态操作数通过重构MSE搜索选择一个可表示的2的幂缩放;动态训练操作数使用ceil-absmax缩放。我们将逐元素张量量化记为Q(X)Q(\bm{X}),因此Q(X)ij=x^ijQ(\bm{X})_{ij}=\widehat{x}_{ij}。
有理基数参数化这个均匀对数格的间距。设p=q=1p=q=1给出电平2e+k/K2^{e+k/K}。选择p/q<1p/q<1会在不改变元素宽度的情况下收缩范围并增加局部分辨率,而p/q>1p/q>1则会扩大范围。CurveFP将每个间距与下面推导的相位计数关联起来,从而暴露一个直接的质量-复杂度控制。
### 3.2 闭合乘积与相位结构化累加
均匀的曲线索引使乘积码本精确闭合。对于两个曲线索引分别为ii和jj的非零操作数,定义
l=(i+j)modK,c=⌊i+jK⌋.\ell=(i+j)\bmod K,\qquad c=\left\lfloor\frac{i+j}{K}\right\rfloor.(2)它们的乘积具有符号sx⊕sws_{x}\oplus s_{w}、共享缩放指数ax+awa_{x}+a_{w}、元素指数ex+ew+ce_{x}+e_{w}+c和曲线索引l\ell。因此,乘积形成使用一个异或和小整数加法,无需通用逐变量乘法器,也无需最近码投影。零哨兵将乘积短路为零,而不应用索引更新。这个闭合乘积路径馈入一个固定的相位归约以及二进制缩放传输;第5节 (https://arxiv.org/html/2608.10010#S5)总结了其部署含义。
闭合性在加宽的乘积坐标上成立。重新量化到有限的EE位目的地时可能会饱和;在显式输出重新量化之前,不需要码本投影。
有理基数在保持这种闭合性的同时,改变了点积所需的二进制相位数量。由方程1 (https://arxiv.org/html/2608.10010#S3.E1)可知,每个未缩放幅值为
re+k/K=2p(eK+k)/(qK).r^{e+k/K}=2^{p(eK+k)/(qK)}.(3)令N=qKN=qK。当整数n=eK+kn=eK+k前进时,分数指数是pnmodNpn\bmod N除以NN的余数。由pp在ZN\mathbb{Z}_{N}中生成的加法子群的阶为
H=qKgcd(p,qK)H=\frac{qK}{\gcd(p,qK)}(4)因此,它在底层格上定义了HH个相位类别。有限的格式可能使某些类别为空,但每个点积都可以在这些HH个相位上调度,并写作
x^Tw^=∑h=0H−12h/H∑tnh,t2t,\widehat{\bm{x}}^{\mathsf{T}}\widehat{\bm{w}}=\sum_{h=0}^{H-1}2^{h/H}\sum_{t}n_{h,t}2^{t},(5)其中每个nh,tn_{h,t}是一个有符号整数计数。乘积被精确路由到按二进制移位索引的整数计数;归约后只剩下HH个固定相位权重。
#### 构造性算术实现。
令g=gcd(p,qK)g=\gcd(p,qK),nx=exK+kxn_{x}=e_{x}K+k_{x},nw=ewK+kwn_{w}=e_{w}K+k_{w},以及u=p(nx+nw)u=p(n_{x}+n_{w})。每个非零通道将Ah,tA_{h,t}增加δ=(−1)sx⊕sw\delta=(-1)^{s_{x}\oplus s_{w}},其中h=(umodqK)/gh=(u\bmod qK)/g,t=ax+aw+⌊u/(qK)⌋t=a_{x}+a_{w}+\lfloor u/(qK)\rfloor;零则抑制更新。对于p=q=1p=q=1,h=(kx+kw)modKh=(k_{x}+k_{w})\bmod K,且t=ax+aw+ex+ew+⌊(kx+kw)/K⌋t=a_{x}+a_{w}+e_{x}+e_{w}+\lfloor(k_{x}+k_{w})/K\rfloor。相似文章
CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本
CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。
@AaronWeiHuang:我们最新博客探讨了FP4如何从压缩工具演变为训练和推理的实用基础方案,涵盖……
NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。
重新思考LLM FP4预训练中的收缩偏差:几何起源、系统性影响与UFP4方案
本文识别了LLM预训练中非均匀FP4量化格式的一个根本限制(收缩偏差),并提出了UFP4,一种优于现有基于E2M1方法的统一4位训练方案。
SharQ:连接激活稀疏性与FP4量化以优化大语言模型推理
SharQ提出了一种无需训练的方法,将激活稀疏性与FP4量化相结合用于大语言模型推理,采用稀疏-密集分解和统一的FP4权重负载。与仅使用FP4的基线相比,它显著降低了延迟并恢复了精度。
prism-ml/Ternary-Bonsai-27B-mlx-2bit
Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。