量子捷径:复数相位状态动态减少序列模型的优化步骤

arXiv cs.LG 论文

摘要

本文探讨在序列模型中使用受量子理论启发的复数状态,表明它可以在 Mamba 和基于注意力的模型中减少优化步骤,并提高样本效率。

arXiv:2608.14691v1 Announce Type: new 摘要:序列模型传统上通过其骨干网络(backbone)来区分,即跨位置路由信息的机制,如注意力(attention)或循环(recurrence)。本文改变了在骨干网络之前、且几乎所有当前模型共享的一个选择:\emph{基底(substrate)},即隐状态表示所使用的数系以及从状态到预测的映射形式。主流的基底是使用仿射--softmax读出的实数值状态;我们研究一种从量子理论数学中提取的复数值替代方案,其中信息由状态的相位携带,分数是二次型Born形式。先前的工作证明了这种基底的理想化版本在表征能力上强于任何具有线性读出的实模型;我们探究它是否也能训练得更快。通过放宽阻碍部署的两个性质——精确幺正性和Born词汇表读出,我们在 Mamba 状态空间模型和基于注意力的 Transformer 中实例化了它。在 253M 参数下,参数匹配至 $0.02\%$ 以内,并在一个固定的协议下在三个字节级语料库上训练,复数模型在大约三分之一(状态空间)和二分之一(注意力)的优化步骤内达到了其对应实模型的所有测量验证损失。然后,两种骨干网络出现分歧。一旦学习率预热结束,状态空间的优势继续扩大,在 OpenWebText 上从 $0.321$ 增加到 $0.354$ 比特每字符,在 FineWeb 上从 $0.368$ 增加到 $0.396$,这是预热斜坡的人工制品所无法实现的;而注意力优势则在每个语料库上衰减至零,因此是早期训练的效果。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:26

# 复杂相态动力学减少序列模型优化步骤

来源:https://arxiv.org/html/2608.14691  
Ahmed Nebli cAI Technology GmbH [email protected] & Hadi Saadatdoorabi cAI Technology GmbH [email protected] & Christopher Keibel Independent Researcher [email protected] & Kevin Yam Yam Technology Consulting [email protected]  

###### 摘要  
序列模型传统上通过其骨干结构来区分——即跨位置路由信息的机制,例如注意力或循环。本文探讨了一个先于骨干结构的选择,该选择几乎被所有当前模型共享:**基质**,即隐藏状态的数值系统,以及状态到预测的映射形式。主流基质是具有仿射-softmax读出的实值状态;我们研究了一种源自量子理论数学的复值替代方案,其中信息由状态的相位携带,评分采用二次型Born形式。先前的研究证明,在具有线性读出的情况下,这种基质表示形式在理论上强于任何实模型;我们探究其是否也能加速训练。通过放松阻碍部署的两个特性——精确幺正性和Born词表读出——我们在Mamba状态空间模型和基于注意力的Transformer中实例化了这一方案。在253M参数规模下,参数匹配精度在0.02%以内,并在三个字节级语料库上使用统一协议进行训练时,复模型达到每个测量的验证损失所需的优化步骤约为其实值对应模型的三分之一(状态空间模型)和二分之一(注意力模型)。两种骨干结构的表现随后出现分歧。学习率预热期结束后,状态空间模型的优势持续扩大,在OpenWebText上从0.321扩大到0.354比特/字符,在FineWeb上从0.368扩大到0.396——这是预热阶段无法解释的现象;而注意力模型的优势在所有语料库上都衰减至零,因此只是早期训练阶段的效应。该比较基于每步相同token数计算优化步骤,对于注意力模型对,当前的内核开销抵消了步骤优势带来的实际时间节省。我们分析了两种候选机制并公开了所有代码和训练日志。  
*关键词*:序列建模⋅状态空间模型⋅复值网络⋅量子启发方法⋅样本效率⋅优化  

## 1 引言  
序列建模——根据序列中的元素预测下一个元素的任务——是现代语言模型和大量当代机器学习的基础。序列模型的设计通常由其骨干结构描述,即信息从较早位置到达较后位置的规则。Transformer通过全局自注意力进行聚合\[55\];状态空间模型通过固定维度的线性递推传播信息\[17, 16\];长卷积模型通过学习的核混合位置信息\[44\]。这些机制在表达能力、并行性和长期依赖保持方面的权衡已有详细阐述\[53, 52, 17\]。  
第二个设计选择——几乎被所有这些模型隐式采用——仅被很少改变(例外情况在第4节综述):隐藏状态的数值系统,以及状态到下一个token分布映射的函数形式。在当前主流设计中,状态是$\mathbb{R}^d$中的向量,输出映射是仿射变换后接softmax。我们将这对组合——状态的数域和读出形式——称为模型的**基质**,并将其视为与骨干结构不同的设计维度;其是否独立于骨干结构正是本实验要检验的(第9.1节)。  
基质之所以重要,是因为它影响遗忘机制的工作方式。实值模型通过收缩状态分量来遗忘,而实数收缩会退化其携带的信息;每个位置衰减百分之一,经过一千个位置后,最早位置的信号将只剩下不到0.005%。复数携带两个可分离的量:幅值和相位。本文研究的基质将信息存储在相位中,遗忘仅通过幅值收缩实现,并通过二次型读出从相位差中提取预测——在该读出下,当两个贡献的相位相反时会相互抵消;这是相消干涉现象,与声学降噪中利用的原理相同。收缩不改变相位,因此存储的信息在幅度上衰减而不失真;干涉允许证据反对假设而不仅仅是衰减其强度,干涉强度由参与的幅值设定。  
经验发现是:基于这种基质构建的模型,在参数规模相同且训练方式相同的实值模型中,达到我们测量的每个质量水平所需的优化步骤约为后者的三分之一(状态空间骨干)到二分之一(注意力骨干),语料库规模覆盖100 MB到15 GB。该基质仅借鉴了量子理论的数学;模型是经典的,并运行在标准加速器上。  
实值仿射-softmax基质有两个公认的限制,且两者都独立于骨干结构。首先,从$d$维状态的仿射映射后接softmax实现的对数概率矩阵秩至多为$d+1$\[61\]。当数据的条件结构具有更高秩时,无论状态如何计算,读出都是误设的。其次,谱半径$\rho<1$的实线性递推在$T$步内使传播梯度衰减$\rho^T$,这是经典的梯度消失情形\[2, 40\]。在典型深度状态空间模型的工作点(如$\rho=0.99$且$T=1024$),该因子约为$\rho^T \approx 3.4 \times 10^{-5}$:到早期位置的梯度路径实际上被切断。改变信息路由方式无法消除这两个限制。  
这两个限制也指出了补救措施必须作用之处:读出必须突破秩上限,递推必须在收缩不衰减的量中携带信息。本文研究的复值基质将二次型读出与相位存储的信息配对,同时做到了这两点,第6节详细阐述了每一点。  
两个限制都涉及训练和表示,并激发了我们测量的量:达到目标损失所需的优化步骤数。这个数字决定了消耗的计算量,在固定批量大小下,也决定了达到给定质量所消耗的数据量;一个能减少该数字的基质,将提升采用它的每个骨干的训练成本和样本效率。  
如结果所示,基质之间的差异在训练的最初步骤中就已确立,并在那里达到最大。这种每步数量,而不仅仅是最终损失,是本研究的主要衡量指标。  
将数域从$\mathbb{R}$改为$\mathbb{C}$的动机是一个特定的结构特性:干涉。在实向量空间中,两个状态分量的组合是其幅值的单调函数。在复向量空间中,组合还受其相对相位支配,因此固定幅值的两个分量可以增强或抵消。一个简单的例子(我们在全文中会反复讨论)说明了这对语言建模的后果。一个字节级模型在读取字符"1 9 4"后,必须保持其上下文的两种解释:作为年份前缀(如1945)和作为价格前缀(如19.4)。实模型将两种解释都作为幅值保持,一旦后续字节确定了答案,就通过一个学习的门控将劣势解释的幅值抑制向零。复模型则可以推进两种解释的相对相位,使得在二次型读出下,劣势解释与即将到来的证据发生相消干涉,而优势解释发生相长干涉。这一区别是实质性的,因为相消严格扩展了衰减:门控只能将分量驱动向零,而干涉允许一个仍然存在的分量对结果产生反对作用。正是这种丰富性使得交流分析、傅里叶光学和量子力学在复数域中变得可处理。  
复值基质最初由Nebli等人以理想形式发展\[37\]。其中隐藏状态是$\mathbb{C}^N$中的单位范数向量;其演化由学习的哈密顿量生成且精确幺正,通过Cayley(Crank-Nicolson)映射离散化,该映射在任何步长下都保持状态范数;下一个token分布是Born规则$p_v = |\langle e_v | \psi \rangle|^2$,这是状态的二次型。该工作证明了表示分离:一个维度为$N$的复幺正模型可以精确解决的相位消歧任务族,需要任意具有仿射-softmax读出的实正交模型维度为$\Omega(N^2)$,因为二次型读出访问了状态密度矩阵的$\Theta(N^2)$个成对相位相关性,而状态的线性泛函无法分辨;这些相关性是$\Theta(N^2)$个测量方向,而非$\Theta(N^2)$个独立的状态坐标,因为纯态簇的实维度是$2N-1$。这种分离是表示性的:它说明了每类模型在其最优处能表达什么,但对训练如何达到最优保持沉默。  
理想基质的两个特性阻碍了直接部署,本文研究放松这些特性的后果。精确幺正性不允许遗忘:范数保持的递推无法衰减不再重要的状态分量,而门控自LSTM以来一直是循环模型的遗忘机制\[25, 13\],Gu和Dao的消融实验将选择性状态空间模型相对于其时不变前身的提升归因于这种依赖输入的遗忘\[16\]。此外,对大小为$V$的词表进行Born读出每步成本为$O(NV)$,如果要实现其秩优势,会将状态宽度绑定到$\sqrt{V}$,这在子词词表规模下是不利的。  
因此,我们构建了一个**可部署**基质:将幺正性放松为收缩性的、依赖输入的递推,该递推保持每个转移特征值的相位在单位圆上;Born规则仅在低成本处应用,作为线性注意力内核的评分函数,而词表读出保持为绑定的softmax。第5节详细说明了每个放松放弃了什么和保留了什么。  
主要的实证结果是,这个可部署基质在253M参数规模下,使用单一训练协议,在三个跨越$150\times$大小范围的字节级语料库上,达到每个测量的验证损失所需的优化步骤约为实值Mamba的三分之一和实值Transformer的二分之一。我们将此减少称为**量子捷径**。它在训练早期就已确立:H-Mamba在约第78步通过2.5比特/字符,实值Mamba在约第252步达到该水平,并且当目标从2.5下降到2.0比特/字符时,步骤比例几乎保持不变。  
由于测量目标在学习率预热期间被跨越,我们单独检查预热结束后的情况(第8.2节)。两种骨干结构在那里表现不同,这也是结果的一部分:状态空间模型的差距在预热阶段结束后继续扩大,而注意力模型的差距衰减至零。因此,加速在早期阶段与骨干结构无关,并且根据当前证据,仅对循环结构持续有效。  
比较设计针对了最直接的替代解释。每对中的成员参数数量匹配精度在0.02%以内,排除了原始参数计数作为驱动因素;训练协议在模型间一致,并遵循此规模下已发布的配方\[3\],这反驳了调优伪影的可能;损失下降范围内比例的稳定性与初始化的暂时优势不一致;以及效果在两种几乎没有计算结构共同点的骨干结构上的重复出现,使得纯粹针对骨干结构的解释不太可能。  
有一个注意事项:复注意力的融合内核目前吞吐量仅为其实值对应的一半,因此对于该对,步骤减少在实际时间上实现了持平而非节省;并且状态空间比较缺乏优化的实值基线内核;因此,捷径的价值体现在优化步骤和数据效率上,而非实际时间(第8.4节)。  
本文有三个贡献。首先,我们定义了可部署的复值基质并描述了其两种放松:用收缩代替幺正性,用Born评分代替Born词表头,并说明了每种放松放弃了什么和保留了什么(第5节)。其次,在本文的核心结果中,我们确立了量子捷径:在匹配容量和相同协议下,该基质将每个测量目标的步骤数减少到大约三分之一(状态空间骨干)和二分之一(注意力骨干),在三个语料库上均匀适用(第7和8节;图1和图3;表5和6)。第三,我们从两个方向解释了该效应:优化下限将仿射-softmax读出的秩与其能达到的损失联系起来,精确传输引理表明相位坐标以单位灵敏度穿越收缩递推,而其可观测效应仍受参与幅值的缩放(第6节),并且逐层梯度测量在训练模型中表现出预期行为(第8.4节);这些共同将状态空间加速归因于递推而非读出。

相似文章

Gated QKAN-FWP: Scalable Quantum-inspired Sequence Learning

Hugging Face Daily Papers

# Paper page - Gated QKAN-FWP: Scalable Quantum-inspired Sequence Learning Source: [https://huggingface.co/papers/2605.06734](https://huggingface.co/papers/2605.06734) Authors: , , , , , , , , , , , , , , , , , ## Abstract Quantum\-inspired fast\-weight programming framework using single\-qubit circuits achieves superior forecasting performance with reduced parameters compared to classical recurrent models while maintaining NISQ device compatibility\. [Fast Weight Programmers](https://huggingfac

基于混合态原型的量子增量学习

arXiv cs.AI

本文介绍了一种基于可训练混合态原型的量子增量学习框架,能够在无需增加电路宽度的前提下添加新类别,同时缓解灾难性遗忘。