现代 Transformer 是隐式的混合体:从功能分化到原则性混合架构设计

arXiv cs.LG 论文

摘要

本文提出了基于干预的指标,以区分 RoPE Transformer 中的检索头和位置头,从而推导出一种原则性混合架构 (HwH),该架构结合了全注意力和线性注意力,以改善语言建模和长上下文外推。

arXiv:2609.02986v1 Announce Type: new 摘要: 结合全注意力 (FA) 和线性注意力 (LA) 的混合架构日益突出,但它们的分配仍然是启发式的。我们寻求基于证据的基础,在 RoPE Transformer 学习的头级功能组织中。行为探针无法提供完整的分类,因此我们提出两个干预指标:RoPE 频率重要性分数 (RFIS),衡量每个频率如何影响头的注意力分布;以及 RoPE 位置依赖性 (RPD),隔离对旋转位置调制的依赖。在 Qwen3 系列模型和 Llama3.1 上,RFIS 建议且 RPD 验证了一个完整的检索头和位置头分类,由一个显著的中低频带分隔。受控 Transformer 表明,这个边界遵循训练长度的位置尺度;我们称之为全局位置带 (GPBand)。分析表明了零样本长度外推失败的潜在原因,并得出了两个原则:位置建模应仅在本地操作,通过位置无关检索进行全局访问;并且两个功能都应以头粒度分配,并具有层特定分配。我们在 Head-wise 混合架构 (HwH) 中实例化它们,使用 NoPE FA 进行全局检索,LA 进行本地位置建模。当 FA 到 LA 的比例低于 1:3 时,HwH 保持强大的语言建模和常识推理能力,同时改善检索并显著增强零样本长上下文外推,优于 Transformer、LA 和层式混合基线。消融实验验证了两个原则和组件角色,突出了原则性混合架构设计作为未来基础模型的有前景路径。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:17

# 现代Transformer是隐式混合架构:从功能分化到原则性混合架构设计
来源:https://arxiv.org/html/2609.02986  
Runlin Shi Bojian Yin Guoqi Li  
中国科学院自动化研究所,北京,中国††thanks:通讯作者\.

###### 摘要

结合全注意力(FA)和线性注意力(LA)的混合架构日益重要,但其分配方式仍主要依赖启发式方法。我们试图在现代基于RoPE的Transformer所学到的头级功能组织中寻找基于证据的基础。行为检索和局部流式探测揭示了有用的倾向,但未能产生完整的分类体系。因此,我们提出了两种基于忠实干预的指标:*RoPE频率重要性评分*(RFIS),用于衡量每个频率成分如何影响头的完整注意力分布;以及*RoPE位置依赖性*(RPD),用于分离旋转位置调制的效应。应用于Qwen3系列模型和Llama3.1后,RFIS提出并RPD验证了一个完整的二元分类体系,包括RoPE Transformer中的检索头和位置头,二者由一个显著的中低频带分隔。受控Transformer实验表明,这种功能分隔带遵循训练长度的位置尺度;我们将此机制层面的边界称为*全局位置带*(GPBand)。其全局位置依赖性暗示了零样本长度外推失败的潜在原因,并且与层特定的头分布相结合,产生了两个设计原则:*\(i\)*位置建模应仅在局部操作,而全局访问应通过位置无关的检索实现;以及*\(ii\)*检索和位置功能应在头粒度上分配,并具有层特定的分配。我们在*头级混合架构*(HwH)中实例化了这些原则,使用无位置编码FA进行全局检索,使用LA进行局部位置建模。总体FA与LA的比例低于1:3,HwH在保持强大的语言建模和常识推理能力的同时,改善了检索性能,并显著增强了相对于Transformer、LA以及1:3层级混合基线的零样本长上下文外推能力。消融实验验证了这两个原则及各组件的作用,凸显了原则性混合架构设计作为未来基础模型有前景的路径。

## 1 引言

图1:概览:从Transformer功能分化到原则性混合设计。\((a)\)通过QR分数衡量的Qwen3\-4B检索倾向。\((b)\)层内头排序后的层特定检索分布。\((c)\)RFIS/RPD揭示GPBand分离的检索与位置功能。\((d)\)HwH实例化了两个原则:*\(i\)*位置建模应仅在局部操作,全局访问应通过位置无关的检索实现;以及*\(ii\)*检索和位置功能应在头粒度上分配,并具有层特定分配。\((e)\)在真实世界检索基准上的比较。\((f)\)在NIAH\-Single\-2上的零样本长度外推。\((g)\)无位置编码FA服务全局检索;LA服务局部位置建模。全注意力(FA)提供了精确的令牌到令牌访问,但导致二次序列复杂度(Vaswani et al., 2017)和在自回归解码过程中随上下文增长的KV缓存(Shazeer, 2019)。固定状态的LA提供了循环效率(Katharopoulos et al., 2020),但在精确的长程检索方面可能遇到困难(Arora et al., 2024a; Jelassi et al., 2024)。它们的组合很有吸引力,但任一机制都无法决定混合架构应如何组织。现有系统依赖于固定分配或经验选择的架构(Lieber et al., 2024; Wang et al., 2025; Team et al., 2025; Dong et al., 2024; Zuo et al., 2025)。这使得核心设计问题悬而未决:应该将哪些角色分配给FA或LA,以何种粒度,以及采用何种分配策略?

现代基于RoPE的Transformer所学到的功能分化提供了一个自然的设计参考(图1)。先前的工作识别了支持长程访问的检索头(Wu et al., 2024; Zhang et al., 2025b);随后的方法利用这种特化性进行训练后KV缓存优化或检查点转换(Xiao et al., 2024; Tan et al., 2026)。然而,这些方法始于预训练的Transformer,并未独立地表征互补功能;因此,它们本身无法从头开始为架构设计提供基础。

为了建立一个完整的机制层面分类体系,我们从头级功能分化的行为探测开始。我们使用QRscore(Zhang et al., 2025b)衡量检索倾向,并引入LDscore衡量局部流式倾向。这两个探测并未产生完整的分类体系,因此仅凭行为证据无法对所有头进行机制层面的分类。因此,我们转向底层的RoPE频率依赖性,并提出了两种基于忠实干预的指标。*RoPE频率重要性评分*(RFIS)衡量移除一个频率成分如何改变头的完整注意力分布,而*RoPE位置依赖性*(RPD)则分离该效应是否源于旋转位置调制。RFIS提出并RPD直接验证了RoPE Transformer中包含检索头和位置头的完整二元分类体系:前者强调低于显著中低频带的频率,后者则强调该频带及其以上的频率。这些结果共同确立了检索和位置建模作为互补的机制层面功能。

受控Transformer进一步表明,这种功能边界遵循训练长度的位置尺度。因此,我们将其称为*全局位置带*(GPBand)。相关的全局位置拟合暗示了超出训练长度的失败模式。结合图1b中深度变化的头分布,这产生了两个原则:*\(i\)*位置建模应仅在局部操作,全局访问应通过位置无关的检索实现;以及*\(ii\)*检索和位置功能应在头粒度上分配,并具有层特定的分配。

我们在头级混合架构(HwH)中实例化了这些原则,将无位置编码FA分配给全局检索,将LA分配给局部位置建模,并设定层特定FA与LA的比例不超过1:3。从头开始的预训练表明,HwH保持了强大的语言建模和常识推理能力,改善了检索性能,并显著增强了相对于Transformer、纯LA和层级混合基线的零样本外推能力。组件和分配消融实验进一步验证了这两个原则以及FA和LA各自的角色(图1d–g)。

我们的贡献总结如下:
- 我们提出了RFIS和RPD,这是用于RoPE频率分析的、基于忠实且有界干预的指标,并用它们建立了RoPE Transformer中检索和位置建模的完整头级分类体系。
- 我们将RoPE Transformer中与训练长度相关的显著中低频带表征为此分类体系的功能边界,将其命名为GPBand,并将全局位置拟合识别为外推失败的潜在原因。
- 我们推导出两个混合设计原则,并通过从头开始的HwH实验进行了验证,这些实验也确认了LA在局部位置建模中的作用以及无位置编码FA在位置无关全局检索中的作用。
- 我们揭示了RoPE Transformer是隐式的功能混合体,并推动了采用更好的特定功能组件的原则性混合作为未来基础模型有前景的路径。

## 2 预备知识

#### 全注意力和分组查询注意力。  
对于序列 \(X \in \mathbb{R}^{T \times d}\),FA(Vaswani et al., 2017)形成 \(Q = XW^Q\),\(K = XW^K\),和 \(V = XW^V\)。一个维度为 \(d_h\) 的头输出  
\[
O = \operatorname{softmax}\!\left(\frac{QK^{\top}}{\sqrt{d_h}} + M\right)V,
\]  
其中 \(M\) 是因果掩码。FA 需要 \(O(T^2)\) 对交互,其 KV 缓存随上下文线性增长。分组查询注意力(GQA)(Ainslie et al., 2023)将 \(G \leq H\) 个 KV 头中的每一个共享给一组 \(H\) 个查询头;令 \(g(h)\) 将查询头 \(h\) 映射到其 KV 头。\(G=H\) 和 \(G=1\) 的情况分别恢复了 MHA 和 MQA(Shazeer, 2019)。我们分别测量每个查询头,因为它保留自己的查询投影和注意力分布。

#### 线性注意力。  
LA 用固定大小的循环状态替代成对的 FA(Katharopoulos et al., 2020)。一个基本的递归是  
\[
S_t = S_{t-1} + v_t k_t^\top, \qquad o_t = S_t q_t,
\]  
其中 \(S_t \in \mathbb{R}^{d_v \times d_k}\),对于固定维度,它提供了线性序列复杂度和常数大小的循环内存。我们使用门控 DeltaNet(GDN)(Yang et al., 2025b),它增加了数据相关的衰减和 delta 规则更新:  
\[
S_t = S_{t-1}\bigl(\alpha_t(I - \beta_t k_t k_t^\top)\bigr) + \beta_t v_t k_t^\top, \qquad o_t = S_t q_t,
\]  
这里 \(\alpha_t, \beta_t \in (0,1)\) 控制保留和更新。

#### 旋转位置嵌入。  
旋转位置嵌入(RoPE)将每个查询和键头分成 \(F = d_h/2\) 个二维组,并以频率 \(\omega_r\) 旋转组 \(r \in \{0, \ldots, F-1\}\)(Su et al., 2023):  
\[
\omega_r = \theta^{-2r/d_h}, \quad R(\varphi) = \begin{bmatrix} \cos\varphi & -\sin\varphi \\ \sin\varphi & \cos\varphi \end{bmatrix}, \quad
\tilde{q}_t^{(r)} = R(t\omega_r) q_t^{(r)}, \quad \tilde{k}_s^{(r)} = R(s\omega_r) k_s^{(r)}.
\]  
这里 \(\theta\) 是 RoPE 基,\(r=0\) 是最高频率。所得点积分解为精确的频率贡献:  
\[
\tilde{q}_t^{\top} \tilde{k}_s = \sum_{r=0}^{F-1} \left(q_t^{(r)}\right)^{\top} R\!\left((s-t)\omega_r\right) k_s^{(r)},
\]  
因此每个组都有旋转周期 \(2\pi/\omega_r\) 和独特的位置尺度。

## 3 功能分化与混合设计原则

### 3.1 注意力头倾向的行为探测

我们使用 QRscore(基于查询到证据的注意力)测量每个查询头的检索倾向(Zhang et al., 2025b),并使用 LDscore(基于近期窗口内非汇聚注意力的比例)测量其局部流式倾向(附录A.1)。

Qwen3\-4B 是分析的主要模型;Qwen3\-1.7B、Qwen3\-8B 和 Llama3.1\-8B\-Instruct 提供了跨规模和跨系列的检查(附录A.3)。其检索倾向是稀疏的,在边界层缺失,并集中在中间附近(图1a–b)。由于检索和局部流式倾向并非全局互补(附录A.2),它们提供了行为锚点和层特定的分配模式,但不是完整的分类体系。

### 3.2 RFIS 揭示检索–位置功能分化

为了表征这些行为倾向背后的 RoPE 频率依赖性,我们引入了 *RoPE频率重要性评分*(RFIS)。RFIS 移除头 logits 中的一个二维频率贡献,同时保持所有其他贡献固定,然后测量完整注意力分布的最终变化。形式上,对于样本 \(x\),令 \(\mathcal{C}_x(i)\) 为查询位置 \(i\) 可见的键。在层 \(\ell\)、查询头 \(h\) 和频率 \(r\) 处,令 \(g(h)\) 为其 GQA KV 头,查询-键 logit 的精确贡献是  
\[
c^{\mathrm{RoPE}}_{\ell,h,i,j,r} = \mathbf{q}_{\ell,h,i,r}^{\top} R\!\left((j-i)\omega_r\right) \mathbf{k}_{\ell,g(h),j,r}.
\]  
可见键上的完整 logits 和注意力分布是  
\[
z_{\ell,h,i,j} = \sum_{r=0}^{F-1} c^{\mathrm{RoPE}}_{\ell,h,i,j,r}, \qquad \mathbf{p}_{\ell,h,i} = \operatorname{softmax}(\mathbf{z}_{\ell,h,i}).
\]  
移除频率 \(r\) 给出  
\[
\mathbf{z}_{\ell,h,i}^{(-r)} = \mathbf{z}_{\ell,h,i} - \mathbf{c}^{\mathrm{RoPE}}_{\ell,h,i,r}, \qquad \mathbf{p}_{\ell,h,i}^{(-r)} = \operatorname{softmax}\!\left(\mathbf{z}_{\ell,h,i}^{(-r)}\right).
\]  
对于分布 \(\mathbf{a}, \mathbf{b}\) 和 \(\mathbf{m} = (\mathbf{a} + \mathbf{b})/2\),令  
\[
D_{\mathrm{JS}}(\mathbf{a}, \mathbf{b}) = \frac{1}{2} D_{\mathrm{KL}}(\mathbf{a} \| \mathbf{m}) + \frac{1}{2} D_{\mathrm{KL}}(\mathbf{b} \| \mathbf{m}).
\]  
每个查询和聚合的分数是  
\[
I^{\mathrm{RFIS}}_{\ell,h,i,r} = \frac{D_{\mathrm{JS}}\!\left(\mathbf{p}_{\ell,h,i}, \mathbf{p}_{\ell,h,i}^{(-r)}\right)}{\ln 2}, \qquad \operatorname{RFIS}_{\ell,h,r} = \mathbb{E}_{x\sim\mathcal{D}}\, \mathbb{E}_{i\sim\mathcal{Q}(x)}\!\left[ I^{\mathrm{RFIS}}_{\ell,h,i,r} \right].
\]  
嵌套期望对样本进行等权重。RFIS 是一种基于忠实干预的指标,自然有界于 \([0,1]\);较大的值表示对由该频率表示的信息的依赖性更强。附录C给出了进一步的理论细节。

图2中的 RFIS 面板显示,在两个代表性层中都存在一个显著的中低频带。检索头更依赖于低于该频带的频率,而位置头则更依赖于该频带及其以上的频率。

相似文章

在词元级别上比较Transformer和混合模型

Lobsters Hottest

本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

HydraHead:从头部级功能异质性到专注意力混合

Hugging Face Daily Papers

HydraHead 是一种新颖的注意力混合架构,通过在头部层级结合完全注意力和线性注意力,利用可解释性驱动的选择和尺度归一化融合,实现长上下文性能卓越并减少训练开销。

Olmo Hybrid:从理论到实践再回到理论

arXiv cs.CL

本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。

Transformer之药

Reddit r/ArtificialInteligence

对Transformer架构在大型语言模型之外广泛影响的反思,包括对语言学、遗传学和因果建模的潜在影响,并将其意义与哈伯-博世法相提并论。