递归推理模型的量化

arXiv cs.LG 论文

摘要

本文研究了对递归推理模型的量化,其中权重共享块被重复使用,发现每张量4位量化会导致灾难性漂移,但每块缩放(如MXInt4)能恢复准确性,且更深层的架构更为敏感。

arXiv:2607.16237v1 Announce Type: new 摘要:递归推理模型通过多次细化步骤应用紧凑的权重共享块来解决难题。由于这些块被多次重用,量化它们会产生一个独特的动态问题:每一步都会产生量化误差。尽管8位量化(整数或浮点)能保持准确性,但转为每张量4位格式会导致系统性偏差累积。随之而来的漂移灾难性地降低了Sudoku上精确解的准确率,从84.1%降至0.0%(只有约25%的单元格正确)。在这项工作中,我们表明这种崩溃是由激活缩放粒度引起的,而不是位宽或数字格式。关键的是,转向每块缩放完全恢复了转换。为了实现这一点,我们将MXInt4(一种块状整数激活格式)应用于递归推理模型。它在我们的任务中与块状浮点格式具有竞争力,同时保持整数元素和2的幂次块缩放。最后,递归深度和重用调节了量化的敏感性,我们测试的最深层架构(EqR均衡模型)最为敏感。然而,块状缩放克服了这一弱点,在这些架构中保持鲁棒性,并迁移到了开放式的ARC-AGI基准测试。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:47

# 量化递归推理模型  
来源:https://arxiv.org/html/2607.16237  
Gamze İslamoğlu¹,Luca Benini¹  
¹综合系统实验室,苏黎世联邦理工学院,瑞士  
通讯作者:thoriri@iis\.ee\.ethz\.ch  

###### 摘要  
递归推理模型通过在许多精炼步骤中应用紧致、权重固定的模块来解决难题。由于这些模块被多次重用,量化它们会带来独特的动态问题:量化误差在每一步都会产生。虽然8位量化(整数或浮点)能保持精度,但转向逐张量4位格式会导致系统性偏差累积。由此产生的漂移灾难性地将数独的精确求解准确率从84.1%降至0.0%(仅约25%的单元格正确)。在本文中,我们表明这种崩溃是由激活缩放*粒度*造成的,而非位宽或数字格式。关键在于,转向逐块缩放完全恢复了过渡。为了实现这一点,我们将MXInt4(一种块状整数激活格式)应用于递归推理模型。在我们的任务中,它与块状浮点格式具有竞争力,同时保持整数元素和2的幂次方块缩放。最后,递归深度和重用调节了量化敏感性,我们测试的最深架构(EqR均衡模型)最为敏感。然而,块状缩放克服了这种脆弱性,在这些架构中保持稳健,并迁移到开放式的ARC-AGI基准测试中。

## 1 引言  
最近的一系列研究表明,通过用少量参数递归组织计算,可以解决困难的推理问题。层次推理模型(HRM)(Wang等人,2025 (https://arxiv.org/html/2607.16237#bib.bib2))和微型递归模型(TRM)(Jolicoeur-Martineau,2025 (https://arxiv.org/html/2607.16237#bib.bib1))通过在许多精炼步骤中应用紧凑、权重固定的过渡函数,在数独、迷宫求解和ARC-AGI上达到了竞争性的准确率。这一研究方向已经扩展到随机、自回归、混合、长周期和语言模型变体(Sghaier等人,2026 (https://arxiv.org/html/2607.16237#bib.bib4);Baek等人,2026 (https://arxiv.org/html/2607.16237#bib.bib5);Rauba等人,2026 (https://arxiv.org/html/2607.16237#bib.bib7);Wang和Reid,2026 (https://arxiv.org/html/2607.16237#bib.bib10);Yang等人,2026 (https://arxiv.org/html/2607.16237#bib.bib16);Wang等人,2026 (https://arxiv.org/html/2607.16237#bib.bib3))。这些模型之所以对低精度推理有吸引力,恰恰是因为它们的参数量很小。然而,它们在量化下的行为基本上仍未研究:它们几乎完全以全精度报告,没有附带低精度准确度或轨迹分析。  

为了理解量化行为,我们将递归推理器视为一个学习到的状态空间计算。给定输入\(x\),一个共享的过渡算子反复精炼一个潜在推理状态和一个答案状态。量化本质上是将这个算子替换为一个扰动的或有噪声的过渡。在标准的前馈模型中,量化器扰动一个由不同层组成的有限序列。然而,在权重固定的递归中,*同一个*量化过渡被多次重用。这使得诱导出的轨迹与一步误差同样重要。虽然递归可能安全地吸收一个近似零均值的扰动,但系统性偏差的表现则不同。它可以在每一步都将轨迹或其收敛到的固定点推向一致的方向,导致强烈的累积漂移。  

本文在重用过渡算子的层面上研究量化。我们研究了低位过渡在重复应用下何时保持忠实,以及如何构建这样的过渡。我们做出了三项主要贡献:  

##### 1. 量化作为过渡扰动。  
我们将全精度过渡与其量化版本应用于相同推理状态进行比较(第3节 (https://arxiv.org/html/2607.16237#S3))。实验表明,8位整数精度表现为一个小扰动。量化轨迹向全精度路径收缩,准确度得以保持。相反,逐张量4位量化会导致严重的轨迹漂移,数独精确准确率从84.1%降至0.0%。位移集中在最重用的递归层(每次前向传递336×次),并且与重用深度直接成比例。  

##### 2. 块状整数过渡规则。  
我们表明激活缩放*粒度*是主导控制变量(第4节 (https://arxiv.org/html/2607.16237#S4))。仅权重量化4位只损失几个百分点。然而,当以4位量化激活时,逐张量整数(Int4,0.0%)和浮点(FP4,0.6%)格式都失去了精确准确率。相比之下,逐块缩放完全保留了过渡。我们使用MXInt4(一种具有整数尾数的块状激活格式)应用了这一原则,在数独上达到80.1%,在迷宫上达到84.7%,在这些任务上与块状浮点格式具有竞争力,同时保持整数元素和2的幂次方块缩放。此外,测试的异常值控制方法(SmoothQuant、Hadamard旋转)未能提供相同的训练后稳定性。  

##### 3. 递归深度和重用调节了可量化性。  
我们通过一系列架构(第5节 (https://arxiv.org/html/2607.16237#S5))展示了这一点。最深的*均衡递归(EqR)*最为敏感。逐张量Int4阻止了吸引子收敛,随机广度无法平均系统性误差。然而,我们的逐块规则恢复了稳定性并保持了深度缩放(0.01% → 82.3%)。在架构轴的随机端,注入测试时噪声并未改善Int4的性能。这证实了误差是系统性的,而非可平均的。最后,相同的逐块规则成功迁移到了开放式的ARC-AGI基准测试。我们还表明,*量化感知训练(QAT)*提供了一条补充的权重侧路径,以实现更好的准确率(第4.6节 (https://arxiv.org/html/2607.16237#S4.SS6)和第4.5节 (https://arxiv.org/html/2607.16237#S4.SS5))。  

参见说明  
图1:过渡收缩与漂移(数独)。量化和全精度轨迹在16步递归上的发散。(a) 潜在状态和(b) 答案对数概率发散(对数y轴):逐张量Int4在潜在空间中保持高位,在对数概率空间中增长(一致漂移),而8位*和*逐块MXInt4都向全精度轨迹*收缩*。(c) 最终精确准确率:逐张量4位消除了每一个精确解(测得0.0%),而Int8(≈全精度)和逐块MXInt4(80.1%;第4节 (https://arxiv.org/html/2607.16237#S4)开发的修复方法)恢复了接近全精度的准确率。Int8也是逐张量,因此失败是逐张量*4位*特有的,而逐块MXInt4则修复了这一点。在较浅的迷宫递归(约3步;此覆盖率下逐张量Int4为77.7%对比全精度84.7%)上,漂移较温和。  

## 2 背景与相关工作  
##### 递归和循环推理模型。  
最近一系列工作使用微型的递归应用网络解决困难的谜题和推理任务。例如,HRM(Wang等人,2025 (https://arxiv.org/html/2607.16237#bib.bib2))耦合了两个以不同频率运行的权重固定循环模块。TRM(Jolicoeur-Martineau,2025 (https://arxiv.org/html/2607.16237#bib.bib1))将其简化为一个单层两层、约7M参数的模块。通过多次递归该模块,它使用LLM参数的一小部分达到了ARC-AGI-1上的45%。这些架构与权重固定的递归Transformer(Dehghani等人,2019 (https://arxiv.org/html/2607.16237#bib.bib11))和循环Transformer(Giannou等人,2023 (https://arxiv.org/html/2607.16237#bib.bib12);Xu和Sato,2025 (https://arxiv.org/html/2607.16237#bib.bib13))有着共同的渊源。它们使用自适应计算机制(Graves,2016 (https://arxiv.org/html/2607.16237#bib.bib14))控制共享模块的应用次数。从概念上讲,它们也与深度均衡模型(Bai等人,2019 (https://arxiv.org/html/2607.16237#bib.bib15))平行,后者将权重固定模块迭代到不动点。这个架构空间正在迅速扩展。随机变体使用测试时噪声或学习到的每步过渡来探索多个解轨迹(Sghaier等人,2026 (https://arxiv.org/html/2607.16237#bib.bib4);Baek等人,2026 (https://arxiv.org/html/2607.16237#bib.bib5))。自回归变体将标准Transformer变形为共享模块递归(Rauba等人,2026 (https://arxiv.org/html/2607.16237#bib.bib7))。相邻的工作包括课程学习、状态空间混合和长周期问题分解(Qasim和Zhang,2025 (https://arxiv.org/html/2607.16237#bib.bib9);Wang和Reid,2026 (https://arxiv.org/html/2607.16237#bib.bib10);Yang等人,2026 (https://arxiv.org/html/2607.16237#bib.bib16))。最近,HRM-Text(Wang等人,2026 (https://arxiv.org/html/2607.16237#bib.bib3))甚至将这种递归结构应用于高效的语言模型预训练。尽管扩张迅速,但关于这些模型的文献完全由全精度研究组成。我们的工作解决了量化与递归结构之间缺失的交互。  

##### 量化权重固定和循环网络。  
量化重用权重的困难是一个众所周知的现象:循环量化明显比前馈更脆弱,RNN二值化在低精度前馈网络成功的任务上失败(Ott等人,2016 (https://arxiv.org/html/2607.16237#bib.bib17);Hubara等人,2018 (https://arxiv.org/html/2607.16237#bib.bib21)),这促使了RNN专用量化器和4位LSTM流水线(He等人,2016 (https://arxiv.org/html/2607.16237#bib.bib18);Alom等人,2018 (https://arxiv.org/html/2607.16237#bib.bib19);Fasoli等人,2021 (https://arxiv.org/html/2607.16237#bib.bib20))。一个反复出现的主题是误差随着通过重用权重的次数增加而增长。Precision Highway管理了这种累积(Park等人,2018 (https://arxiv.org/html/2607.16237#bib.bib22)),累加器感知量化限制了安全求和量化项所需的宽度(Colbert等人,2023b (https://arxiv.org/html/2607.16237#bib.bib23);a (https://arxiv.org/html/2607.16237#bib.bib24))。关于跨层权重共享(Lan等人,2020 (https://arxiv.org/html/2607.16237#bib.bib25))和无限深度均衡(Bai等人,2019 (https://arxiv.org/html/2607.16237#bib.bib15);Li等人,2026a (https://arxiv.org/html/2607.16237#bib.bib26))的理论为我们的主张提供了基础,但累积效应从未在现代化递归推理器上被测量过。我们专注于这一特征:量化轨迹的收缩与漂移行为及其对重用深度的剂量反应。  

##### 迭代模型:扩散量化是最接近的表亲。  
我们的设置最接近的类比是量化扩散,其中每步误差在迭代的共享权重去噪器中累积,而训练后量化(PTQ)扰动的是迭代过渡核,而非独立层(Shang等人,2023 (https://arxiv.org/html/2607.16237#bib.bib35);Li等人,2023 (https://arxiv.org/html/2607.16237#bib.bib36);He等人,2023 (https://arxiv.org/html/2607.16237#bib.bib39))。我们的设置有两个不同之处。首先,扩散步骤*以时间步\(t\)为条件*,允许\(t\)相关的量化参数(So等人,2023 (https://arxiv.org/html/2607.16237#bib.bib46);Huang等人,2024 (https://arxiv.org/html/2607.16237#bib.bib48)),而权重固定推理器用与步骤无关的参数反复应用一个算子。其次,扩散在*感知*流形上漂移,容忍小偏差,而推理器的解流形是*全有或全无*的:单个错位的符号将精确准确率归零。我们的逐张量Int4结果是逻辑空间上这种流形漂移的模拟。我们在附录A.8 (https://arxiv.org/html/2607.16237#A1.SS8)中扩展了比较以及相关的暴露偏差文献(Ning等人,2024 (https://arxiv.org/html/2607.16237#bib.bib27);Arora等人,2022 (https://arxiv.org/html/2607.16237#bib.bib31);He等人,2021 (https://arxiv.org/html/2607.16237#bib.bib32))。  

##### 量化推理模型及低位宽数字格式。  
推理对量化高度敏感。实证研究和广泛的PTQ基准测试表明,8位推理LLM基本无损。然而,随着任务难度增加,较低位宽的风险越来越大(Liu等人,2025a (https://arxiv.org/html/2607.16237#bib.bib56);Zhao等人,2025 (https://arxiv.org/html/2607.16237#bib.bib61))。对数学推理的细粒度分析已经定位了这些量化引起的失败。过程级归因表明,单个早期错误步骤可以级联并毁掉整个思维链(Li等人,2025 (https://arxiv.org/html/2607.16237#bib.bib57);2026c (https://arxiv.org/html/2607.16237#bib.bib58))。最近的工作使用QAT、前瞻损失和对关键权重的针对性保护来诊断和缓解这一问题(Lv等人,2026 (https://arxiv.org/html/2607.16237#bib.bib62);Zhang等人,2026c (https://arxiv.org/html/2607.16237#bib.bib63);Choi等人,2026 (https://arxiv.org/html/2607.16237#bib.bib64);Zhang等人,2026b (https://arxiv.org/html/2607.16237#bib.bib59))。权重固定递归代表了这种脆弱性的最尖锐实例。完全相同的推理模块必须在数千次重用中保持忠实。  

在格式方面,微缩放(MX)为小块分配共享指数(Rouhani等人,2023 (https://arxiv.org/html/2607.16237#bib.bib65);开放计算项目,2023 (https://arxiv.org/html/2607.16237#bib.bib66))。LLM的共识是4位MXFP是有损的且是一个开放挑战,狭窄的动态范围会降低准确率(Zhang等人,2026a (https://arxiv.org/html/2607.16237#bib.bib68);Fasoli等人,2026 (https://arxiv.org/html/2607.16237#bib.bib67))。弥合这一差距需要诸如溢出感知缩放、旋转或元数据增强格式等机制(Chhugani等人,2026 (https://arxiv.org/html/2607.16237#bib.bib69);Egiazarian等人,2026 (https://arxiv.org/html/2607.16237#bib.bib70);Lee等人,2025 (https://arxiv.org/html/2607.16237#bib.bib71);Hu等人,2026 (https://arxiv.org/html/2607.16237#bib.bib73);Shao等人,2025 (https://arxiv.org/html/2607.16237#bib.bib85);Li等人,2026b (https://arxiv.org/html/2607.16237#bib.bib86);Meng等人,2026 (https://arxiv.org/html/2607.16237#bib.bib74)),并且训练配方可以通过随机舍入或振动控制使MXFP4/NVFP4接近无损(Tseng等人,2025 (https://arxiv.org/html/2607.16237#bib.bib75);Castro等人,2025 (https://arxiv.org/html/2607.16237#bib.bib76);Chmiel等人,2025 (https://arxiv.org/html/2607.16237#bib.bib77);NVIDIA等人,2025 (https://arxiv.org/html/2607.16237#bib.bib78);Chen等人,2025b (https://arxiv.org/html/2607.16237#bib.bib79))。最相关的是,整数与浮点的交叉是依赖于体制的:MXInt在8位时通常超过MXFP,而在4位时浮点通常领先,除非与合适的旋转配对(Chen等人,2025a (https://arxiv.org/html/2607.16237#bib.bib81);Zhang等人,2023 (https://arxiv.org/html/2607.16237#bib.bib82);Ashkboos等人,2024 (https://arxiv.org/html/2607.16237#bib.bib83);Liu等人,2025b (https://arxiv.org/html/2607.16237#bib.bib84))。

相似文章

量化推理模型自以为需要更长的思考,实则不然

arXiv cs.LG

本文揭示,对推理模型进行激进的训练后量化会导致过度思考错误增加,即模型在中间步骤得出正确答案却未能作为最终答案输出。对过度思考标记施加简单的logit惩罚,可将思维链长度减少12-23%,同时提升准确率,尤其对量化模型效果显著。

K-Quantization 及其对输出性能的影响

arXiv cs.CL

本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。