跨GPU内核的确定性LLM推理:二的幂次INT8量化缩放与基于容差一致性检查的局限性

arXiv cs.LG 论文

摘要

本文评估了LLM推理中INT8量化的一致性测试套件,发现二的幂次量化缩放能够实现跨内核的位级确定性,而基于容差的检查仅限于预条件和有界性。

arXiv:2609.00363v1 公告类型:新 摘要:量化GEMM内核的一致性测试套件询问两个实现在容差范围内是否一致。我们测量了此类套件能检测到的内容。通过向参考INT8管道注入九种故障,在Qwen3-1.7B的8,232个层--故障--配置单元上,我们发现五种尾声故障中的每一种——缩放精度、双重舍入、乘法顺序、输出截断、融合排序——最多将输出移动一个bfloat16间距,并且在移动时恰好移动一个,在5,880个单元中如此。因此,一个间距的容差在结构上对此类故障视而不见:五种故障中有四种未被套件中的任何检查检测到,第五种仅在二的幂次缩放时被检测到。违反累加器精确预条件或破坏操作数共享的故障会被无一例外地检测到,空故障从未触发。因此,此类基于容差的套件建立的内容比互换性更窄:预条件成立,操作数共享,差异保持在一个间距内。暴露一种检测故障的二的幂次约束也是可部署的。将每个重量缩放重新量化到最近的二的幂次,使CUTLASS和Triton在每个线性层(196/196和252/252,而检查点自身缩放时为8/196和10/252)上位级一致,并在1.7B、8B和14B上产生字节相同的生成令牌序列(8/8个提示,而所有三个规模上为0/8)。观察到的困惑度点估计为+0.32%、-0.28%和+0.48%;90%置信区间在两个较小规模上覆盖零,但在14B上不覆盖,达到+0.71%和+0.76%。先前报告的此干预的+157%困惑度是探测器在重新量化重量之前重写缩放的伪影;分离效应后,将99.8%归因于由此产生的重量--缩放不匹配,而非二的幂次约束本身。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:12

# 跨GPU内核的确定性LLM推理:二的幂次INT8量化尺度与基于容差的符合性极限
来源:https://arxiv.org/html/2609.00363
陈腾瑞††致谢:T\.\-R\. Chen 就职于 Krixvon,台北 100,台湾(电子邮箱:luka@krixvon\.com;ORCID:0000\-0001\-8995\-334X)。††致谢:预印本,2026年8月。arXiv:2608\.13756的配套论文,本文解答了该论文关于检查敏感性及二的幂次尺度可部署性的未解问题;与配套论文的文本重叠极少,本文所有结果均为新成果。所有测量均在单张 RTX 4090 显卡上、遵循预先注册且仅可追加修正的协议、使用固定软件栈完成。

###### 摘要

INT8量化现已成为大语言模型的标准部署配置,两个实现相同缩放INT8 GEMM接口的GPU内核通常被视为可互换的。一项配套研究(arXiv:2608\.13756)证明它们在比特级别不可互换,将分歧定位到后处理阶段——精确整数累加器后的缩放乘法与最终舍入,并将其控制因素提炼为一个符合性套件;然而,该套件仅在假设良好的内核上运行过,其检查从未被证明能触发故障,且同一研究报道其二的幂次尺度探测导致困惑度上升157%,使得唯一的比特严格检查缺乏可服务的检查点来运行。本文对两个差距进行了测量。

测量检查敏感性需要已知真实值的故障,因此我们构建了一个累加器设计上精确的参考流水线,注入了九类故障——五种看似合理的后处理缺陷、两种前置条件违规、一种操作数失配和一种空操作——覆盖Qwen3\-1\.7B的196个捕获层、三种覆盖严重程度和两种尺度模式:共8,232个单元格,每个都依据一个77单元格的预测矩阵评分,其63单元格核心在任何数据前即已固定;一次公开的两层试运行将其扩展至77单元格并修正了三个预测,修正后的矩阵在完整运行前重新固定。该套件针对修正后的矩阵记录了零假阳性和零假阴性,但五类后处理故障中的四类在任何单元格中都未被任何检查检测到:每个后处理故障移动输出最多一个bfloat16间距——只要移动就恰好移动一个间距——因此容差为一个间距的设计从构造上就对该类故障失明,而操作数失配的误差可达数万量级。

可部署性失败的原因与报道不同:在二的幂次尺度下从父权重重新量化——通过在非约束规则下逐字节重建已提交的检查点来验证——将探测的157%中的99.8%归因于探测构建中的权重与尺度失配,而非约束本身。重新量化的检查点使CUTLASS和Triton在每个线性层实现比特一致(在196/196和252/252层,而使用检查点自身尺度时仅为8/196和10/252),并在1\.7B、8B和14B模型上产生字节一致的贪婪词元序列(所有三个模型在8/8个提示上一致,而对照组为0/8),困惑度点估计分别为+0\.32%、−0\.28%和+0\.48%(90%置信区间在两个较小模型上覆盖零,但在14B模型上不覆盖,其上端达到+0\.71%和+0\.76%)。因此,二的幂次尺度是跨内核比特确定性的可部署配置,也是本套件后处理比较从容差转变为强制相等的条件:这种形式的基于容差的套件诚实认证的是前置条件、操作数来源和间距约束有界性——而非互换性。

###### 索引术语:

量化推理,GPU内核,数值可复现性,故障注入,符合性测试,二的幂次尺度,大语言模型服务。

图1:概述。*上图:*在已验证的界限下,W8A8线性层的整数累加是精确且与顺序无关的,因此跨内核差异只能出现在后处理阶段;九类故障被注入,真实值由构造已知,并依据预测矩阵(63单元格在数据前固定;经公开试运行修正并重新固定)评分。*左下:*该套件对其自身的前置条件和操作数来源可靠,但在结构上对停留在单个bfloat16间距内的后处理缺陷失明——这正是单次舍入和精度缺陷所在。*中下:*通过重新量化而非尺度重写构建的二的幂次尺度,在观测到的困惑度代价介于−0\.28%与+0\.48%之间时,实现了跨内核的比特一致同意。## I引言

两个实现相同缩放INT8 GEMM接口的GPU内核通常被视为可互换的,生产服务栈将两者间的选择视为实现细节:vLLM通过硬件和启发式方法在CUTLASS和Triton路径间为同一量化线性层进行选择\[1 (https://arxiv.org/html/2609.00363#bib.bib1),2 (https://arxiv.org/html/2609.00363#bib.bib2),3 (https://arxiv.org/html/2609.00363#bib.bib3)\],而INT8 W8A8仍是服务大语言模型的标准配置\[4 (https://arxiv.org/html/2609.00363#bib.bib4),5 (https://arxiv.org/html/2609.00363#bib.bib5),6 (https://arxiv.org/html/2609.00363#bib.bib6)\]。该选择是否在输出中*可观察*,是一个具有实际利害关系的可复现性问题:回归测试、缓存评估、审计追踪以及任何跨部署比较词元概率的流水线都假设内核选择会相互抵消。

事实并非如此,本文直接延续了确立此结论的研究——*《整数不在场证明》*\[7 (https://arxiv.org/html/2609.00363#bib.bib7)\],arXiv:2608\.13756——因此有必要首先说明该研究的发现及其未解决的问题。在保持检查点、提示、硬件、引擎、解码和量化配置固定,仅交换INT8线性内核的情况下,研究发现每个分支自身比特可复现,但两个分支在*所有*生成序列上不一致。随后定位了分歧:由于INT8×INT8乘积在INT32中累加在无溢出界限下是精确且顺序无关的,累加器不可能导致任何跨内核差异——一个*整数不在场证明*——因此任何差异必然出现在后处理阶段,即应用缩放并将结果舍入为bfloat16的地方(图1 (https://arxiv.org/html/2609.00363#S0.F1),上图)。从这些控制中,它提炼出一个七检查符合性套件,并使用二的幂次尺度重写作为诊断探测,恢复了端到端的比特一致。这属于大语言模型推理中非确定性研究\[8 (https://arxiv.org/html/2609.00363#bib.bib8),9 (https://arxiv.org/html/2609.00363#bib.bib9),10 (https://arxiv.org/html/2609.00363#bib.bib10),11 (https://arxiv.org/html/2609.00363#bib.bib11)\]以及更早的数值内核测试传统\[12 (https://arxiv.org/html/2609.00363#bib.bib12),13 (https://arxiv.org/html/2609.00363#bib.bib13),14 (https://arxiv.org/html/2609.00363#bib.bib14),15 (https://arxiv.org/html/2609.00363#bib.bib15)\],在第二节 (https://arxiv.org/html/2609.00363#S2) 中综述。

然而,该研究未证明其两个操作性结论,并明确指出了这一点。首先,套件仅在假设良好的内核上运行:“这些是通过的检查,而非证明能触发的检查”——其对实际故障内核的敏感性从未被测量,而一个仅与良好实现达成一致的套件,仅凭这一历史就从未被测试过。其次,探测检查点使困惑度降低了157%,因此该研究明确拒绝声称二的幂次尺度是可部署的缓解措施——使得套件中唯一的比特严格检查缺乏可服务的检查点来运行。本文测量了两者。

本文弥合了两个差距,而两个答案结果是一个故事(图1 (https://arxiv.org/html/2609.00363#S0.F1),下图)。我们通过故障注入测量套件的敏感性:一个W8A8流水线的参考实现,其累加器设计上精确,九类注入故障真实值由构造已知,操作数从Qwen3\-1\.7B的196个捕获层重放,并且每个检查‑故障结果都预先预测:一个在任何数据前固定的63单元格矩阵,经一次公开的两层试运行扩展至77单元格并修正三个预测,然后在完整执行前重新固定。结果是一份清晰的记分卡,其解读是负面的:针对修正后的矩阵零假阳性和零假阴性,但五类后处理故障中的四类在4,704个单元格中均未被任何检查捕获。原因是结构性的。单次舍入模式或精度故障将输出移动到相邻的可表示值——最多一个bfloat16间距,只要移动就恰好移动一个间距——而一个间距已经是容许任何合法浮点差异的最小容差。基于容差的后处理符合性失败并非因为其阈值选择不当,而是因为故障类与合法类占据同一区间。出路是要求相等而非容差的检查,而该检查需要二的幂次尺度——因此约束的可部署性不再是准确性问题,而是后处理可检查性的代价。我们证明报道的157%是探测构建的假象(它重写了存储的尺度而未重新量化权重,这恰好是操作数失配类的故障),并且重新量化的二的幂次检查点在三个模型大小下观测到的困惑度点估计介于−0\.28%与+0\.48%之间,同时使两个内核逐字节一致。

测量规范在此至关重要,因为敏感性研究可通过选择其已捕获的故障来美化自身,而成本研究可通过与稻草人比较来美化自身。因此,两项测量均在预先注册且仅可追加修正的协议下运行:故障目录、原始63单元格预测矩阵、所有阈值和分析规则在P5数据前即已固定;一次公开的两层试运行随后扩展了矩阵并修正了三个预测,修正后的77单元格矩阵在完整执行前重新固定,结果在原始和修正矩阵下均报告(第III\-E节 (https://arxiv.org/html/2609.00363#S3.SS5));并且重新量化流水线通过在构建任何约束分支前逐字节重建已提交的基线检查点来验证(第V\-A节 (https://arxiv.org/html/2609.00363#S5.SS1))。

具体而言,本文贡献如下:

1. 1\.对现有符合性套件的敏感性测量,通过九类注入故障、具有构造性真实值、覆盖8,232个层‑故障‑模式单元格,依据一个77单元格的预测矩阵评分(63单元格在数据前固定;三个在公开试运行后修正):针对修正后的矩阵零假阳性和零假阴性——原始矩阵下检测率为75.0%,假阳性率为55.76%/11.39%——同时五类后处理故障中的四类完全未被检测(第IV节 (https://arxiv.org/html/2609.00363#S4))。
2. 2\.结构性解释与撤回:每个注入的后处理故障都停留在正确输出的一个bfloat16间距内,因此套件的真实尺度容差检查从构造上对该类失明;配套论文中将套件定位为决定内核互换性的表述被撤回,并替换为检查实际确立的内容——前置条件、操作数来源和间距有界性。
3. 3\.作为可部署确定性机制的二的幂次尺度:重新量化(非重写)的二的幂次检查点在1\.7B、8B和14B上实现逐层比特一致(196/196,252/252)和字节一致生成,测量到的困惑度点估计从−0\.28%到+0\.48%(90%置信区间达到+0\.71%和+0\.76%)——其99.8%的分解终结了报道的157%(第V节 (https://arxiv.org/html/2609.00363#S5))。
4. 4\.量化流水线的逐字节精确重建——包括量化除法本身在bfloat16中进行的细节——这使得“分支仅在尺度规则上不同”成为可审计的属性而非意图(第V\-A节 (https://arxiv.org/html/2609.00363#S5.SS1))。

本文其余部分组织如下。第二节 (https://arxiv.org/html/2609.00363#S2) 陈述流水线、不在场证明和按处理轴划分的相关工作。第三节 (https://arxiv.org/html/2609.00363#S3) 描述故障注入设计:参考流水线、故障目录、检查和两阶段固定预测矩阵。第IV节 (https://arxiv.org/html/2609.00363#S4) 报告敏感性测量及其结构性解读。第V节 (https://arxiv.org/html/2609.00363#S5) 报告二的幂次部署结果:重新量化门控、三种尺寸的确定性、精度代价以及探测157%的分解。第VI节 (https://arxiv.org/html/2609.00363#S6) 界定可得出的结论,第VII节 (https://arxiv.org/html/2609.00363#S7) 以该证据支持的策略作结。

## II背景与相关工作

本节固定记法以及一切所依赖的唯一理论事实,然后按三个轴将本文置于先前工作之中;表I (https://arxiv.org/html/2609.00363#S2.T1) 总结了比较。

### II\-A流水线与不在场证明

W8A8线性层计算Y=\(AW⊤\)⋅saswY=\(AW^\{\\top\}\)\\cdot s\_\{a\}s\_\{w},其中AA是M×KM\{\\times\}K int8激活块,具有逐词元尺度sas\_\{a};WW是N×KN\{\\times\}K int8权重矩阵,具有逐通道尺度sws\_\{w};乘积在INT32中累加,缩放结果舍入为bfloat16。整数累加在无溢出时是精确且顺序无关的,对于此处研究的检查点,每个乘积的界限恰好是16256:量化器除以255/2=127\.5,将*权重*带至−128到128,而捕获的激活在196层中的每一层都保持在\[−127,127\]内,因此最大乘积是128×127

maxi,j⁡\|accij\|≤16256K<231for allK≤132,104。\max\_\{i,j\}\|\{\\rm acc\}\_\{ij\}\|\;\\leq\;16256\,K\;<\;2^\{31\}\\quad\\text\{for all \}K\\leq 132\{,\}104\.\(1\)
在\(1 (https://arxiv.org/html/2609.00363#S2.E1)\) 下,任何平铺、任何分割KK、任何归约树都产生相同的INT32值;累加器无可置疑,跨内核差异只能出现在后处理阶段。第二个事实是二的幂次可交换性

rnd⁡\(x\)⋅2k=rnd⁡\(x⋅2k\)\\mathrm\{rnd\}\(x\)\\cdot 2^\{k\}\;=\\;\\mathrm\{rnd\}\(x\\cdot 2^\{k\}\)\(2\)
对有限正规值成立:如果所有尺度都是二的幂次,后处理阶段的两种合法乘法顺序产生比特相同的float32,并且最终转换对同一值舍入一次,因此比特相等从*要求*变为预期。两个事实、其硬件验证以及其失效情形(次正规数、溢出)均在配套研究中确立\[7 (https://arxiv.org/html/2609.00363#bib.bib7)\];本文将其视为已知。

### II\-B按处理轴划分的相关工作

表I:本文定位。"比特" = 在比特粒度比较输出;"真实值" = 针对构造已知存在的故障评估测试套件;"可部署成本" = 测量确定性机制在服务检查点上的精度代价;"前置条件" = 验证检查是否触发

相似文章

CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本

arXiv cs.LG

CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。