Q-Interference:内存高效的相位感知量子启发注意力机制

arXiv cs.CL 论文

摘要

本文提出Q-Interference,一种用于GPT模型的内存高效量子启发注意力机制,该机制使用相位感知评分和精确三角因式分解,以改善令牌交互而不增加内存开销。

arXiv:2608.17288v1 宣布类型:新 摘要:GPT注意力通过点积相似度衡量令牌兼容性。这种机制简单、有效且内存高效。但它没有明确建模强令牌特征是否应该相互增强或抑制。我们引入Q-Interference,一种用于自回归语言建模的完全经典量子启发注意力机制,该机制为每个查询和键特征增加幅度和学习相位。得到的注意力分数是相位感知的,对齐相位产生建设性贡献,而冲突相位产生破坏性贡献。尽管Q-Interference产生了比单纯相似度更丰富的交互规则,但Q-Interference的朴素实现需要一个大的令牌对特征交互张量,使其内存密集且往往不实用。为了解决这一限制,我们提出一种精确三角因式分解,使用两次标准矩阵乘法计算相同分数,避免大中间张量的实体化。Q-Interference可以直接嵌入GPT中的Transformer块,并保持模型架构的其余部分和下一个令牌预测目标不变。在公共基准数据集和基线模型上的实验表明,所提出的重新表述在受控的GPT风格设置中稳定训练,并提供相对于朴素相位感知干扰注意力的一致内存优势。这些结果支持本工作的具体贡献:一种精确的内存高效重新表述,使相位感知干扰注意力在标准GPT流程中实用。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:54

# Q-Interference: 内存高效的相位感知量子启发注意力  
来源:https://arxiv.org/html/2608.17288  
Emama Nahid  
所属机构:Kennesaw State University  
地址:Marietta, GA, USA  
邮箱:[enahid@students\.kennesaw\.edu](mailto:)  
Tahmid Imtiaz Imu  
所属机构:Kennesaw State University  
地址:Marietta, GA, USA  
邮箱:[timu1@students\.kennesaw\.edu](mailto:)  
Huayue Gu  
Liran Ma  
所属机构:Miami University  
地址:Oxford, OH, USA  
邮箱:[mal18@MiamiOH\.edu](mailto:)  
Zhipeng Cai  
所属机构:Georgia State University  
地址:Atlanta, GA, USA  
邮箱:[zcai@gsu\.edu](mailto:)  
Honghui Xu  
所属机构:Kennesaw State University  
地址:Marietta, GA, USA  
邮箱:[hxu10@kennesaw\.edu](mailto:)  

###### 摘要  
GPT注意力通过点积相似性衡量词元兼容性。该机制简单、有效且内存高效,但未显式建模强特征间应相互增强还是抑制。我们提出Q-Interference——一种完全经典的量子启发注意力机制,用于自回归语言建模。该方法通过幅度和可学习相位增强每个查询与键特征,使最终注意力得分具有相位感知性:相位一致的特征产生建设性相互作用,相位冲突则产生破坏性相互作用。尽管Q-Interference提供了比单一相似性更丰富的交互规则,但朴素实现需要庞大的词元对特征交互张量,导致内存消耗大且往往不实用。为解决此局限,我们提出一种精确三角分解方法,通过两次标准矩阵乘法计算相同得分,避免了大型中间张量的显式构造。Q-Interference可直接嵌入GPT的Transformer模块,其余模型架构和下一词元预测目标保持不变。在公开基准数据集和基线模型上的实验表明,所提重构方法在受控GPT设置中训练稳定,并比朴素相位感知干扰注意力具有一致的内存优势。这些结果支持了本工作的具体贡献:一种精确的内存高效重构,使相位感知干扰注意力在标准GPT流程中变得实用。代码开源地址:https://anonymous.4open.science/r/Q-Interference-Memory-Efficient-Quantum-Inspired-Attention-BDF9  

## 1 引言  
基于Transformer的GPT模型已成为现代语言处理的基础,因其能够表征词元序列中的上下文 [26] [9]。词元是文本的基本单元,自注意力机制使每个词元能与序列中其他词元进行比较。GPT风格的自回归模型采用因果自注意力,每个位置仅关注先前位置以预测下一词元 [3]。然而,标准注意力通常通过点积衡量词元兼容性,这主要反映特征相似性。这种观点可能遗漏了强特征在特定上下文中应相互支持或抑制的情况。该挑战在长上下文语言建模中更为重要 [7]。文档问答、科学文本建模和检索增强生成等实际系统常依赖分布于多个词元的信息 [1] [15]。这些场景要求模型能关联近处词汇与远距证据。标准稠密注意力让每个词元与多个先前词元比较,因此内存消耗随序列长度增长 [8] [1]。在自回归推理中,键值缓存存储历史键值,并随生成词元增多而膨胀 [11] [14]。因此,内存高效不仅是系统级需求,更是实现更丰富注意力规则规模化应用的前提条件。  

先前研究通过改进内存利用、降低序列计算成本和增强交互结构来提升注意力与语言模型效率 [25]。在效率层面,标准注意力通过内存感知精确计算、低秩结构、随机特征估计、结构化路由和稀疏访问模式等技术得到加速或近似 [8] [27] [6] [24] [28]。这些进展使长序列建模更实用,但基本仍将词元兼容性局限于标准的查询-键相似性视角。在建模层面,量子及量子启发注意力通过基于状态的交互、电路驱动计算和量子风格相似性等方法,提供了表征词元关系的更丰富方式 [16] [4] [12] [13]。量子启发效率技术也被用于降低微调成本和键值缓存存储,但这些贡献作用于创建相位感知交互张量的内部得分计算之外 [5] [11]。综上,这些研究表明注意力可同时变得更高效、更具表现力。然而它们未解决在GPT风格自回归语言建模中直接实现相位感知成对特征交互所产生的特定内存开销。这留下了对精确张量内存高效重构的需求——该重构需保留建设性与破坏性相位交互,同时避免大型中间交互张量。  

我们引入Q-Interference填补这一空白。它是一种用于自回归语言建模的完全经典量子启发注意力机制。该方法通过幅度和可学习相位增强每个查询与键特征:幅度控制特征强度,相位控制特征与其他词元的交互方式。相位一致产生建设性交互,相位冲突则产生破坏性交互。直接实现该思路需要庞大的词元对特征张量,因此我们推导出精确分解方法,通过两次标准矩阵乘法计算相同得分。这使得相位感知计算在保持GPT骨干网络和下一词元预测目标的前提下,相对于额外交互成本具有内存高效性。  

我们的贡献如下:  
- 提出Q-Interference——一种用于GPT风格语言建模的相位感知量子启发注意力机制,利用幅度和可学习相位建模建设性与破坏性词元交互。  
- 推导出相位感知干扰注意力的精确内存高效重构,该重构通过两次标准矩阵乘法计算相同注意力得分。  
- 在受控GPT设置中评估Q-Interference,保持骨干网络和下一词元目标不变以隔离注意力规则的效果。  

## 2 Q-Interference  
我们引入Q-Interference——一种量子启发的GPT变体,将标准点积注意力得分替换为相位感知干扰得分。模型完全基于经典计算,在标准GPU硬件上训练。其目的并非声称量子优势,而是将波形交互的结构化思想融入自回归语言建模。符号与证明假设详见附录B.1 [2]。  

设计保持极简:保留标准GPT骨架,包括词元嵌入、位置嵌入、残差连接、层归一化、前馈模块及下一词元预测目标。如图1所示,唯一修改位于注意力评分规则。这使与标准GPT基线的对比受控,并让改进来源更易解释。  

设 \(X \in \mathbb{R}^{T \times d}\) 表示给定层的隐藏序列表示,其中 \(T\) 为序列长度,\(d\) 为模型维度。标准自注意力计算查询、键和值投影为:  
\(Q = XW_Q,\ K = XW_K,\ V = XW_V\),  
其中 \(W_Q, W_K, W_V \in \mathbb{R}^{d \times d_h}\) 是针对头维度 \(d_h\) 的可学习投影。传统词元 \(i\) 与 \(j\) 间的注意力得分为:  
\(s_{ij}^{\text{std}} = \frac{q_i^\top k_j}{\sqrt{d_h}}\)。  

应用因果掩码 \(M\) 后,归一化注意力权重为:  
\(\alpha_{ij} = \frac{\exp\left(s_{ij}^{\text{std}} + M_{ij}\right)}{\sum_{m \le i} \exp\left(s_{im}^{\text{std}} + M_{im}\right)}\) (1)  
位置 \(i\) 的输出为:  
\(o_i = \sum_{j \le i} \alpha_{ij} v_j\)。  

此重构虽有效,但假设基于幅值的相似性足以捕捉词元兼容性。我们的方法通过引入显式相位分量放宽该假设。  

**相位感知干扰注意力:**  
标准自注意力通过查询-键点积衡量词元兼容性。尽管有效,但该得分主要由幅值驱动,将强特征对齐视为支持性交互。然而在语言中,词元关系可能根据上下文表现为增强或抑制。为更显式建模此特性,我们引入量子启发注意力机制,将特征强度与相对相位对齐相结合。其目标不是声称量子优势,而是采用简单的波形启发原则:对齐信号产生建设性交互,未对齐信号产生破坏性交互。这为注意力得分提供更具表现力的方式,以同时捕捉支持性和冲突性词元关系。  

我们不单独使用实值查询和键向量,而是采用幅值-相位分解表示每个投影特征:  
\(q_i \rightarrow (a_i^q, \phi_i^q),\ k_j \rightarrow (a_j^k, \phi_j^k)\) (2)  
其中 \(a_i^q, a_j^k \in \mathbb{R}_+^{d_h}\) 为非负幅值,\(\phi_i^q, \phi_j^k \in \mathbb{R}^{d_h}\) 为可学习相位。实践中,幅值通过非负激活生成,相位约束在有界区间(如 \([-\pi, \pi]\))内以保证数值稳定性。  

该分解提供简单解释:幅值控制特征参与注意力的强度,相位控制该特征与其他特征的交互方式。相位一致的特征相互增强,相位冲突的特征则相互抑制。如此,词元交互不再仅由特征强度决定,还受相对相位对齐影响。  

给定查询词元 \(i\) 和键词元 \(j\),定义干扰注意力得分为:  
\(s_{ij}^{\text{int}} = \frac{1}{\sqrt{d_h}} \sum_{r=1}^{d_h} a_{i,r}^q \, a_{j,r}^k \cos\left(\phi_{i,r}^q - \phi_{j,r}^k\right)\) (3)  

这是与标准注意力的主要差异。每个特征的贡献不仅取决于幅值,还取决于相位差的余弦值。当相位接近时,余弦项为正且交互增强;当相位不一致时,余弦值减小或变负,抑制交互。因此模型能区分建设性与破坏性词元关系,而非将所有大幅值对齐视为同等支持性。相位感知干扰得分的代数推导见附录B.2 [2]。  

权衡在于:若朴素实现,该丰富交互规则比经典点积注意力计算成本更高。具体而言,直接计算相位感知成对交互会在词元对和特征维度上引入额外中间结构,显著增加内存消耗。这使方法更具表现力,但在规模化时可能实用性降低。为此,我们后续引入内存高效分解,在保留相同干扰得分的同时避免大型中间张量的显式构造。  

得分计算后,注意力流程其余部分保持不变:  
\(\alpha_{ij} = \frac{\exp\left(s_{ij}^{\text{int}} + M_{ij}\right)}{\sum_{m \le i} \exp\left(s_{im}^{\text{int}} + M_{im}\right)},\ o_i = \sum_{j \le i} \alpha_{ij} v_j\)。  

因此,该方案仅修改自注意力内部的兼容性函数,同时保持标准GPT Transformer工作流。  

**内存高效重构:**  
上述相位感知注意力通过允许词元交互经相对相位对齐增强或减弱,提供了比标准点积注意力更丰富的兼容性得分。缺点在于,直接实现需要所有词元对和特征维度间的成对相位交互,引入大型中间张量和高内存成本。我们的方法在保留相位感知得分的同时避免了朴素计算的主要内存瓶颈。  

干扰得分的直接实现在计算上不实用。朴素公式在词元对和特征维度上构造交互张量:  
\(\mathcal{T}_{ijr} = a_{i,r}^q \, a_{j,r}^k \cos\left(\phi_{i,r}^q - \phi_{j,r}^k\right)\)。  
最终得分通过对特征索引 \(r\) 求和获得:  
\(s_{ij}^{\text{int}} = \frac{1}{\sqrt{d_h}} \sum_{r=1}^{d_h} \mathcal{T}_{ijr}\)。  

然而 \(\mathcal{T} \in \mathbb{R}^{T \times T \times d_h}\) 引入大型中间张量,迅速成为主要内存瓶颈——这正是我们旨在消除的低效之处。  

我们的关键技术贡献是干扰得分的精确三角分解。利用恒等式:  
\(\cos(\alpha - \beta) = \cos\alpha \cos\beta + \sin\alpha \sin\beta\),  
可将得分重写为:  
\(s_{ij}^{\text{int}} = \frac{1}{\sqrt{d_h}} \sum_{r=1}^{d_h} \left(a_{i,r}^q \cos\phi_{i,r}^q\right) \left(a_{j,r}^k \cos\phi_{j,r}^k\right) + \frac{1}{\sqrt{d_h}} \sum_{r=1}^{d_h} \left(a_{i,r}^q \sin\phi_{i,r}^q\right) \left(a_{j,r}^k \sin\phi_{j,r}^k\right)\)。

相似文章

Gated QKAN-FWP: Scalable Quantum-inspired Sequence Learning

Hugging Face Daily Papers

# Paper page - Gated QKAN-FWP: Scalable Quantum-inspired Sequence Learning Source: [https://huggingface.co/papers/2605.06734](https://huggingface.co/papers/2605.06734) Authors: , , , , , , , , , , , , , , , , , ## Abstract Quantum\-inspired fast\-weight programming framework using single\-qubit circuits achieves superior forecasting performance with reduced parameters compared to classical recurrent models while maintaining NISQ device compatibility\. [Fast Weight Programmers](https://huggingfac

FourierQK:对查询-键投影进行频谱预处理提升Transformer注意力

arXiv cs.CL

本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。