超越旋转:AuroOFT用于表达性量化正交微调

arXiv cs.LG 论文

摘要

介绍了AuroOFT,一种通过零起点门控低秩非线性残差增强量化正交微调(QOFT)的方法,在低比特语言模型上以更少的可训练参数提升了数学推理准确率,优于QOFT和QLoRA。

arXiv:2608.05253v1 公告类型:新 摘要:量化正交微调(QOFT)通过在冻结的量化权重之前学习结构化激活旋转,实现对低比特语言模型的参数高效适配。然而,其任务特定更新仍局限于线性正交变换,限制了依赖于输入的非线性校正。我们引入了AuroOFT,它在保持QOFT作为稳定的量化兼容分支的同时,为每个适配的线性层附加一个零起点门控低秩非线性残差。AuroOFT将激活映射到RMS归一化的紧凑潜空间,并使用带有有界或令牌依赖门控的自适应非线性基。零初始化的升维投影使得AuroOFT在初始化时与QOFT在功能上完全一致,而正交性仍然作为分支级稳定性属性,而非组合非线性层的属性。在匹配的数据、优化、解码和解析协议下,AuroOFT在1.5B/3B Qwen2.5设置上相比匹配的QOFT将Macro-6提升了1.30-2.70%,超过QLoRA 6.52-10.62%,并在代表性规模上相比QLoRA节省了32.3-44.7%的可训练参数。小型考试式选择题数学集仅作为协议敏感性诊断使用。我们的代码可在匿名仓库获取:https://anonymous.4open.science/r/AuroOFT-F3FD。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:49

# 超越旋转:AuroOFT——用于高表达能力量化正交微调

###### 摘要

量化正交微调(QOFT)通过在冻结的量化权重之前学习结构化的激活旋转,实现了对低比特语言模型的参数高效适配。然而,其任务特定的更新仍局限于线性正交变换,无法进行依赖输入的非线性校正。我们提出 AuroOFT,它保留 QOFT 作为稳定的量化兼容分支,同时为每个适配的线性层附加一个零初始化的门控低秩非线性残差。AuroOFT 将激活映射到 RMS 归一化的紧凑潜空间,并使用带有有界或逐 token 门控的自适应非线性基。上投影的零初始化使得 AuroOFT 在初始化时与 QOFT 在功能上完全等价,而正交性仅作为分支层面的稳定性属性,而非组合后非线性层的属性。在匹配的数据、优化、解码和解析协议下,AuroOFT 在 1.5B/3B Qwen2.5 设置下相较于匹配的 QOFT 将 Macro-6 提升了 1.30–2.70 个点,超过 QLoRA 6.52–10.62 个点,并在代表性规模下相较于 QLoRA 节省了 32.3–44.7% 的可训练参数。小型考试式多项选择数学集仅作为协议敏感性诊断。我们的代码可在匿名仓库获取:https://anonymous.4open.science/r/AuroOFT-F3FD。

## 引言

参数高效微调已成为在实际计算和存储预算下适配大型模型的标准途径(Lialin et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib26))。然而,对于低比特推理模型,一个有效的适配器应表现得像一个*小而忠实的校正层*。它必须与冻结的量化基础模型并存,保留有用的预训练几何结构,同时仍然表达数学推理所需的输入依赖校正。图1 (https://arxiv.org/html/2608.05253#Sx1.F1) 总结了这一张力。加性适配器可以很灵活,但未必保留几何结构。正交适配器可以很稳定,但可能限制可用于适配的局部函数。因此,核心问题不仅在于适配器能否做得小,还在于小适配器被允许表达何种校正。

参见图注 图1:研究问题与挑战。低比特推理适配器必须在量化稳定性与表达性校正能力之间取得平衡。这个问题在数学推理中尤为明显。一个模型可能保留了广泛的预训练知识,却仍然失败,因为某个局部符号步骤、选项排除或数值比较需要输入依赖的校正。LoRA 和 QLoRA 通过将更新限制在紧凑的低秩线性子空间中来获得效率(Hu et al. 2022 (https://arxiv.org/html/2608.05253#bib.bib1);Dettmers et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib2))。OFT、OFTv2 和 QOFT 则使用保持结构的正交变换,其中 QOFT 在冻结的 NF4 权重之前应用输入侧的 Cayley-Neumann 旋转(Qiu et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib3), 2025 (https://arxiv.org/html/2608.05253#bib.bib5))。这提供了稳定的量化路径,但任务特定变化仍然是正交线性变换。诸如 LoRAN 和 AuroRA 等非线性低秩方法表明,紧凑适配器不必保持线性(Li et al. 2024a (https://arxiv.org/html/2608.05253#bib.bib10);Dong et al. 2025 (https://arxiv.org/html/2608.05253#bib.bib15)),但它们的设计围绕 LoRA 风格的加性更新,而非 QOFT 所依据的几何主干。

我们将由此产生的差距称为*正交表达性瓶颈*。QOFT 之所以有吸引力,是因为其旋转是结构化的、与量化兼容的,并且围绕冻结的低比特权重保持保守。然而,同样的设计要求每个适配层主要通过输入侧的正交线性族来表达任务变化。对于推理而言,这种范围可能过于狭窄。所需的校正可能依赖于当前 token 状态、潜在算术上下文,或难以仅通过旋转表示的非线性交互。简单地在旋转路径中插入非线性模块会模糊 QOFT 的几何含义,而替换 QOFT 则会丢弃使其有用的稳定性。

*我们能否保留 QOFT 的量化正交路径作为稳定主干,同时赋予每一层表达性非线性校正?*我们的答案是 AuroOFT,一种用于量化正交微调的零启动非线性残差增强方法。每个适配层保持 QOFT 分支不变。激活由学习到的 Cayley-Neumann 适配器旋转,然后通过冻结的 NF4 权重。与此同时,一个较低的分支执行下投影、ANL、零初始化的上投影和门控。两个分支通过残差相加汇合(图2 (https://arxiv.org/html/2608.05253#Sx2.F2))。

这种分解赋予了 AuroOFT 其核心原则。它将*正交性视为稳定的量化主干,非线性视为零启动的残差校正*。非线性分支在不修改量化基础权重、也不在 Cayley-Neumann 旋转内部插入非线性操作的情况下扩展了逐层函数族。上投影的零初始化使得初始模型在功能上与 QOFT 完全等价,而输入依赖的残差有意地将组合层转变为非线性映射。因此,只有 QOFT 分支保持正交结构。AuroOFT 借鉴了 AuroRA 背后的非线性低秩原则,但改变了被增强的对象。非线性映射被放置在量化正交 QOFT 层旁,而不是取代它。

这一区别也决定了方法的评估方式。相较 QLoRA 的提升测试的是参数预算是否比标准低秩加性适配器更有效地使用。相较匹配 QOFT 的提升测试的是非线性残差是否在稳定正交载体之外提供了有用的表达性。因此,我们强调在固定数据、优化器、解码和解析条件下的比较,并将小型或协议敏感的基准视为诊断,而非结构主张的独立证据。

更广泛的观点是,AuroOFT 既不是要求放弃正交性,也不是声称非线性适配器普遍更好。它是一个更具体的提议,指出表达性应进入量化正交适配器的何处。正交分支继续负责稳定的低比特适配。残差分支处理旋转族可能无法捕捉的局部、输入依赖偏差。这种分离使得方法能够在初始化时保留干净的基线计算,暴露一组受控的 AuroOFT 特定变量用于消融,并让科学比较聚焦于新增的校正族。从这个意义上说,该方法在起点上刻意保守,但在优化过程中可以学习的校正方面限制更少。

本文贡献了一个紧凑框架,将上述诊断转化为可测试的适配对象。

- • 一项诊断。*正交表达性瓶颈*隔离了核心局限。输入侧旋转为 QOFT 提供了稳定的量化路径,却将任务更新限制在结构化线性族内。
- • 一个适配对象。AuroOFT 将这一诊断实例化为与 QOFT 并行的零启动门控非线性低秩残差分支,包含 tanh、归一化样条和增强型双 ANL 变体。
- • 一项边界分析。该公式明确了什么被保留、什么未被保留。它涵盖了与 QOFT 的精确初始化等价性、QOFT 族的包含关系、分支受限正交性以及推理期间不可合并的残差开销。
- • 一项匹配评估。数学推理实验对齐了数据、优化、解码和解析器,同时仅将小型考试式多项选择数学集作为协议诊断。协议使用 Macro-6 将相对于 QOFT 的结构性提升与相对于 QLoRA 的参数效率比较分开。

## 相关工作

#### 稳定与量化适配。

PEFT 方法在其选择的适配对象上有所不同。这些包括瓶颈模块(Houlsby et al. 2019 (https://arxiv.org/html/2608.05253#bib.bib16))、提示(Li and Liang 2021 (https://arxiv.org/html/2608.05253#bib.bib17);Liu et al. 2022b (https://arxiv.org/html/2608.05253#bib.bib24))、激活缩放(Liu et al. 2022a (https://arxiv.org/html/2608.05253#bib.bib25))和低秩加性矩阵(Hu et al. 2022 (https://arxiv.org/html/2608.05253#bib.bib1))。量化适配使这一选择更加明确。GPTQ、SmoothQuant 和 AWQ 减少了冻结模型的占用空间(Frantar et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib18);Xiao et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib19);Lin et al. 2024 (https://arxiv.org/html/2608.05253#bib.bib20)),而 QLoRA、LoftQ 和 QA-LoRA 将 LoRA 风格的更新附着到低比特权重上(Dettmers et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib2);Li et al. 2024b (https://arxiv.org/html/2608.05253#bib.bib21);Xu et al. 2024 (https://arxiv.org/html/2608.05253#bib.bib22))。

正交 PEFT 通过学习保持几何结构的旋转改变了先验。OFT 引入了正交微调(Qiu et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib3)),BOFT 使用蝶形因子压缩旋转(Liu et al. 2024b (https://arxiv.org/html/2608.05253#bib.bib4)),OFTv2/QOFT 通过冻结量化权重之前的输入中心 Cayley-Neumann 旋转扩展了这一思想(Qiu et al. 2025 (https://arxiv.org/html/2608.05253#bib.bib5))。这些工作强调效率、低比特兼容性和稳定性,但在推理方面仍留下了一个共同缺口。任务校正通常是线性加性映射或输入侧正交旋转。AuroOFT 保留量化正交载体,同时增加一个独立的非线性校正对象。

#### 表达性残差适配。

表达性 PEFT 问的是一个紧凑适配器能表示什么,而不仅仅是它增加了多少参数。LoRA 分析及 AdaLoRA、DyLoRA、DoRA、VeRA、FourierFT、MiLoRA、MoSLoRA 和 PeriodicLoRA 等变体通过秩分配、共享基、幅度-方向分解、谱系数、混合子空间或分阶段秩增长来丰富低秩更新(Zeng and Lee 2023 (https://arxiv.org/html/2608.05253#bib.bib12);Zhang et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib6);Valipour et al. 2023 (https://arxiv.org/html/2608.05253#bib.bib7);Liu et al. 2024a (https://arxiv.org/html/2608.05253#bib.bib8);Kopiczko et al. 2024 (https://arxiv.org/html/2608.05253#bib.bib23);Gao et al. 2024 (https://arxiv.org/html/2608.05253#bib.bib9);Wang et al. 2025 (https://arxiv.org/html/2608.05253#bib.bib14);Wu et al. 2024 (https://arxiv.org/html/2608.05253#bib.bib11);Meng et al. 2024 (https://arxiv.org/html/2608.05253#bib.bib13))。LoRAN 和 AuroRA 进一步将非线性隐藏映射(包括 tanh 和 B 样条组件)插入低秩路径(Li et al. 2024a (https://arxiv.org/html/2608.05253#bib.bib10);Dong et al. 2025 (https://arxiv.org/html/2608.05253#bib.bib15))。这些工作表明,紧凑适配不必纯粹是线性的,但它们的设计围绕 LoRA 风格的加性更新,而非量化正交主分支。

AuroOFT 在其不同的角色中使用了它们的表达性经验。非线性映射是零启动、门控的,并作为残差置于 QOFT 旁,因此消融可以仅改变校正族,而正交载体保持不变。这种区别对于归因很重要。所提出的残差不是替代性主干,而是一种受控方式,用于测试非线性校正在不改变其量化正交载体的前提下能否扩展 QOFT。因此,比较遵循一个狭窄的原则。保留稳定分支,改变残差分支,并衡量额外表达性在匹配条件下是否改善了适配。这一原则将先前的适配器设计桥接到接下来正式化的 AuroOFT 层。

参见图注 图2:AuroOFT 层。稳定的 QOFT 分支由零启动的门控非线性低秩残差增强。

## 预备知识

#### QOFT。

设 x∈Rdinx\in\mathbb{R}^{d_{\rm in}} 为具有冻结量化权重 Wq,lW_{q,l} 的线性层的输入激活。QOFT 在量化线性映射之前对激活侧应用正交变换。

hlQ=Dequant(Wq,l)⊤Rl⊤x.h_{l}^{Q}=\operatorname{Dequant}(W_{q,l})^{\top}R_{l}^{\top}x.(1)旋转 RlR_l 通过 Cayley 变换由反对称矩阵参数化。OFTv2 将 Cayley 变换中的逆替换为截断 Neumann 级数,我们实验中使用的实现遵循常见的块大小 3232 和五个 Neumann 项设置。对 AuroOFT 而言,重要的一点是正交适配器作用于冻结的 NF4 权重之前。量化基础权重不会被旋转或修改。

#### AuroRA 风格的非线性低秩映射。

LoRA 使用双投影器线性更新。

h=W0x+BAx,h=W_{0}x+BAx,(2)对于固定的 AA 和 BB,这在 xx 上仍然是线性的。AuroRA 在两个投影器之间插入自适应非线性层 σ(⋅)\sigma(\cdot)。

h=W0x+Bσ(Ax).h=W_{0}x+B\sigma(Ax).(3)其 ANL 结合了固定非线性激活和可学习的 B 样条组件。AuroOFT 采用了这一非线性低秩原则,但并不取代 LoRA 分支。它使用非线性映射作为 QOFT 旁的残差。

## 方法

### AuroOFT 层

图2 (https://arxiv.org/html/2608.05253#Sx2.F2) 展示了层级别的构造,算法 1 总结了相应的前向计算。AuroOFT 包装一个已经适配的 OFT/QOFT 线性模块,而非替换它。上分支是继承自 QOFT 的稳定量化正交路径。下分支是对同一激活评估的非线性低秩残差,仅在输出处相加。

对于适配层 ll,AuroOFT 计算以下分支输入和残差输出。

zl=Alx,z~l=Nl(zl),z_{l}=A_{l}x,\qquad\tilde{z}_{l}=\mathcal{N}_{l}(z_{l}),(4)hl\displaystyle h_{l}=hlQ+Δhl,\displaystyle=h_{l}^{Q}+\Delta h_{l},(5)Δhl\displaystyle\Delta h_{l}=Gl(z~l)αrBlDrop(φl(z~l)),\displaystyle=G_{l}(\tilde{z}_{l})\frac{\alpha}{r}B_{l}\operatorname{Drop}\!\left(\phi_{l}(\tilde{z}_{l})\right),其中 hlQh_{l}^{Q} 是式 1 (https://arxiv.org/html/2608.05253#Sx3.E1) 中的 QOFT 输出,Al∈Rr×dinA_{l}\in\mathbb{R}^{r\times d_{\rm in}} 是下投影,Bl∈Rdout×rB_{l}\in\mathbb{R}^{d_{\rm out}\times r} 是上投影,Nl\mathcal{N}_{l} 是恒等映射或 FP32 RMS 归一化,φl\phi_{l} 是紧凑秩 rr 空间中的自适应非线性层,α/r\alpha/r 是残差缩放因子,GlG_{l} 是标量、有界标量或逐 token 门控。这与实现一致。包装一个已经适配的 OFT/QOFT 模块,对同一输入激活评估非线性分支,并将其门控残差加到包装模块的输出上。

这种并行放置是决定性的设计选择。非线性分支不在 Cayley-Neumann 旋转内部,也不改变正交参数化。它在 QOFT 特征计算完成后提供额外的输入依赖校正。零初始化的上投影确保这条额外路径从非激活状态开始。

相似文章

输出感知的INT2 KV缓存量化旋转方法

arXiv cs.LG

提出了OptR,一种用于INT2 KV缓存量化的输出感知旋转方法,可最小化输出后的注意力误差,在多个模型和基准上改进QuaRot和OSCAR。

LoopQ:递归Transformer的量化

arXiv cs.LG

LoopQ是一种针对循环语言模型的后训练量化框架,解决了分布偏移、状态复用和误差累积问题。在4位权重和激活量化下,平均准确率提升68.8%。