面向大型语言模型的卷积
摘要
本技术报告探讨了在Transformer块中为大型语言模型的查询/键/值投影添加轻量级深度可分离卷积,提供局部归纳偏置,以极小的参数成本提高下游任务准确性。
arXiv:2607.18413v1 公告类型:新
摘要:大型语言模型(LLMs)主要依赖Transformer,其中自注意力机制提供了全局令牌交互,但并未显式编码自然语言的局部性。我们研究轻量级深度可分离卷积是否能在不显著增加模型规模的情况下提供这种局部归纳偏置。宏观层面的消融实验比较了卷积在Qwen3 Transformer块中17个位置的效果,发现将卷积应用于注意力机制之前的投影查询、键和值时效果最佳。后续的微观研究则倾向于采用核大小为$k=3$的残差深度可分离卷积,且无需额外的归一化或激活函数。在多个Qwen3模型和不同预训练数据预算下,该设计在七个下游基准测试中提升了平均准确率,同时仅增加不到$0.01\%$的参数。一项表示层面的案例研究进一步表明,卷积使得重复的令牌ID对其直接上下文更加敏感。这些结果支持深度可分离卷积作为自注意力机制的轻量级补充,用于建模短程令牌交互。
查看缓存全文
缓存时间: 2026/07/22 08:23
# 大型语言模型的卷积技术报告
来源:https://arxiv.org/html/2607.18413
田玉川¹,舒英特¹,何伟²,张硕²,赵天辰³,徐超¹,陈星浩²,王云鹤²,陈汉庭²,†,王宇³
¹北京大学 ²华为技术有限公司 ³清华大学
\(2026年7月\)
###### 摘要
大型语言模型\(LLMs\)主要依赖Transformer架构,其中自注意力机制提供全局的token交互,但并未显式编码自然语言的局部性。我们研究轻量级深度可分离卷积能否在不显著增加模型规模的情况下提供这种局部归纳偏置。我们的宏观消融实验比较了Qwen3 Transformer块中17个位置的卷积,发现将卷积应用于注意力前的投影查询、键和值时效果最佳。随后的微观研究倾向于采用核大小k=3k=3的残差深度可分离卷积,无需额外归一化或激活函数。在Qwen3模型和多个预训练数据预算下,该设计在七个下游基准测试上提升了平均准确率,同时仅增加不到0.01%0.01\%的参数。一项表示层面的案例研究进一步表明,该卷积使得重复的token ID对直接上下文更加敏感。这些结果支持深度可分离卷积作为自注意力机制在建模短程token交互方面的轻量级补充。
11footnotetext:通讯作者。
## 1引言
大型语言模型\(LLMs\),包括DeepSeek\(Liu等人,2024 (https://arxiv.org/html/2607.18413#bib.bib33)\)和Llama\(Grattafiori等人,2024 (https://arxiv.org/html/2607.18413#bib.bib32)\),主要通过扩展Transformer架构构建。它们的基本结构仍然是自注意力层(用于token交互)和前馈网络\(FFNs\)(用于逐token特征变换)的堆叠。诸如多头潜在注意力\(MLA\)和分组查询注意力\(GQA\)等变体提高了注意力的效率,但局部组合仍然是隐式学习,而非直接编码在架构中。
参见图注图1:下游评估总结。左图:在30B token训练预算下,评估的Qwen3模型大小的平均准确率。右图:Qwen3-4B在三种训练数据预算下的平均准确率。Post-QKV深度可分离卷积仅增加不到0.01%0.01\%的参数。自然语言包含大量的短程结构:相邻token构成复合词、短语以及其他有助于句子级意义的单元。例如,在“neural network optimization”中,token“neural”和“network”构成了一个常见的局部单元。Transformer可以通过自注意力学习此类模式,但标准架构并未提供对它们的显式偏好。这促使我们添加一个轻量级的、其感受野天然是局部的算子。
因此,我们重新审视一维卷积,将其作为向现代LLMs添加局部性的一种方式。与使用卷积作为独立块的混合式架构(如Conformer\(Gulati等人,2020 (https://arxiv.org/html/2607.18413#bib.bib34)\))不同,我们将其作为现有Transformer数据路径内的一个小型改进模块。我们的工作假设是,在注意力之前聚合相邻特征可以为后续的长程交互提供局部上下文化的表示。
我们将研究从宏观层面的放置到微观层面的模块设计组织起来。在宏观层面,我们在Qwen3 Transformer块的17个位置插入深度可分离Conv1D。最强的配置是在查询、键和值投影之后、注意力之前应用卷积。在微观层面,我们比较了残差连接、归一化、核大小、初始化、激活函数和重参数化。深度可分离卷积在每个通道上独立操作,使得增加的参数量与隐藏维度成线性关系。
在评估的模型大小和训练数据预算下,得到的模型相较于匹配的Transformer基线,平均下游准确率有所提升。图1 (https://arxiv.org/html/2607.18413#S1.F1)总结了这些结果。我们还检查了一个WSC示例,以评估卷积如何改变重复token ID在不同局部上下文中的表示。
主要贡献如下:
1. 1. 我们比较了Qwen3 Transformer块中的17个卷积位置,并发现Post-QKV卷积在我们的受控放置研究中表现最佳。
2. 2. 我们确定了一个紧凑的模块设计:一个核大小为3且无额外归一化或激活函数的残差深度可分离Conv1D。
3. 3. 我们在Qwen3模型大小和训练数据预算下评估了该设计,观察到平均准确率更高,而额外参数少于0.01%0.01\%。
## 2相关工作
卷积经常与Transformer架构结合,以补充自注意力机制的全局感受野,融入局部结构。我们回顾视觉和语言建模中的代表性方法。
### 2.1Transformer中的卷积
在计算机视觉中,卷积被引入Transformer的多个点。LeViT\(Graham等人,2021 (https://arxiv.org/html/2607.18413#bib.bib1)\)和CoAtNet\(Dai等人,2021 (https://arxiv.org/html/2607.18413#bib.bib2)\)使用卷积嵌入、下采样或卷积块与注意力并行。CvT\(Wu等人,2021 (https://arxiv.org/html/2607.18413#bib.bib3)\)在生成注意力输入之前应用卷积投影,而ConViT\(d’Ascoli等人,2021 (https://arxiv.org/html/2607.18413#bib.bib4)\)则引入了针对局部上下文的门控位置偏置。TiC\(Zhang等人,2023 (https://arxiv.org/html/2607.18413#bib.bib25)\)开发了一种多头自注意力卷积,作为全局注意力的替代方案。卷积也出现在PVTv2\(Wang等人,2022 (https://arxiv.org/html/2607.18413#bib.bib5)\)、SRFormer\(Zhou等人,2023 (https://arxiv.org/html/2607.18413#bib.bib8)\)和CeiT\(Yuan等人,2021 (https://arxiv.org/html/2607.18413#bib.bib24)\)的FFN内部。Conformer\(Gulati等人,2020 (https://arxiv.org/html/2607.18413#bib.bib34)\)在FFN和注意力子层之间放置了一个卷积模块,深度可分离卷积也被用来绕过某些Transformer块\(Zhang等人,2025 (https://arxiv.org/html/2607.18413#bib.bib26)\)。在语言建模中,ConvBERT\(Jiang等人,2020 (https://arxiv.org/html/2607.18413#bib.bib7)\)用基于跨度的动态卷积替换了部分注意力头。
### 2.2语言模型中的局部性
一些语言模型架构通过类似卷积的操作捕获局部或序列结构。RWKV\(Peng等人,2023 (https://arxiv.org/html/2607.18413#bib.bib9)\)将线性注意力与时间衰减相结合,门控Delta网络\(Yang等人,2024 (https://arxiv.org/html/2607.18413#bib.bib10)\)使用循环状态更新。多token注意力\(Golovneva等人,2025 (https://arxiv.org/html/2607.18413#bib.bib11)\)允许查询关注连续的token块。Zoology\(Arora等人,2023 (https://arxiv.org/html/2607.18413#bib.bib12)\)以及关于简单线性注意力的工作\(Arora等人,2024 (https://arxiv.org/html/2607.18413#bib.bib13)\)研究了局部建模在召回和模式匹配任务中的作用。其他方法使用可扩展的查找表表示重复短语\(Cheng等人,2026 (https://arxiv.org/html/2607.18413#bib.bib14)\),或使用参数化的长卷积来捕获多尺度的依赖关系\(Poli等人,2023 (https://arxiv.org/html/2607.18413#bib.bib15)\)。这些模型在机制和范围上有所不同,但它们都提供了无限制的逐token注意力之外的替代方案,用于建模序列结构。
我们的焦点更为狭窄:我们保持Transformer骨干网络不变,并比较轻量级深度可分离卷积可以在何处以及如何插入。这个受控的设计研究分离了放置位置、残差结构、归一化、核大小、初始化、激活函数和重参数化的影响,同时保留了骨干网络的全局注意力机制。
## 3设计卷积增强
### 3.1轻量级局部算子
我们的设计目标是以极小的参数开销和对Transformer块的最小干扰来添加局部归纳偏置。因此,我们使用深度可分离Conv1D作为基本算子,并且不在卷积层内包含密集的跨通道混合。
对于标准1D卷积,核大小为kk,参数数量级为O\(kdmodel2\)\mathcal\{O\}\(kd\_\{\mathrm\{model\}\}^\{2\}\)。Qwen3-1.7B有L=28L=28层,隐藏维度dmodel=2048d\_\{\mathrm\{model\}\}=2048。如果在每一层添加一个k=2k=2的标准卷积,将引入大约2×20482×28≈234.882\times 2048^\{2\}\times 28\approx 234.88百万参数,大约是基线参数量的13.5%13.5\%。
深度可分离Conv1D则在每个通道内操作,将参数复杂度降低到O\(kdmodel\)\mathcal\{O\}\(kd\_\{\mathrm\{model\}\}\)。在相同计算下,它只增加约2×2048×28≈0.112\times 2048\times 28\approx 0.11百万参数,对应基线参数量的约0.006%。通道混合仍然由现有的投影和FFN层负责。
### 3.2比较卷积位置
表1:Qwen3 Transformer块中候选Conv1D位置。我们报告卷积输入宽度、平均损失、WikiText-103困惑度以及总参数量(百万)。参见图注图2:Qwen3 Transformer块及Conv1D模块的17个候选位置。图2 (https://arxiv.org/html/2607.18413#S3.F2)总结了Qwen3 Transformer块\(Yang等人,2025 (https://arxiv.org/html/2607.18413#bib.bib29)\)。输入u\\mathbf\{u\}首先通过RMSNorm归一化得到h\\mathbf\{h\}。然后线性投影生成查询、键和值;在分组查询注意力之前应用QK归一化和旋转位置嵌入(RoPE)。注意力输出被投影并加到u\\mathbf\{u\}上,得到中间状态x\\mathbf\{x\}。接着是第二个RMSNorm和一个SwiGLU FFN。在FFN中,分别的门控和上投影通过将Swish\\mathrm\{Swish\}应用于门控分支并与上分支逐元素相乘来组合。下投影将结果映射回模型维度,然后进行第二次残差加法。
表1 (https://arxiv.org/html/2607.18413#S3.T1)定义了17个候选位置。我们使用Qwen3-1.7B作为骨干网络,在每个位置添加一个Conv1D模块,并在FineWeb-100B\(Penedo等人,2024 (https://arxiv.org/html/2607.18413#bib.bib30)\)上从头训练每个模型。我们报告最后10,000次迭代的平均训练损失、WikiText-103\(Merity等人,2018 (https://arxiv.org/html/2607.18413#bib.bib31)\)上的困惑度以及总参数量。为便于讨论,我们根据位置是直接作用于注意力的输入还是输出来分组。
第一组包含注意力之前、之后或FFN路径中的位置(P1–P4和P10–P17)。在这些位置,卷积作用于进入注意力之前或全局混合之后的表示。大多数配置至少在一个指标上优于基线,但增益差异很大;P3在两个指标上都比基线差。
第二组P5–P9直接作用于注意力组件。P6–P8仅对查询、键或值表示进行卷积,而P5则联合处理拼接后的QKV投影。P9在注意力分数已被用于聚合后应用卷积。在这些选择中,P5获得了最低的平均损失(2.4818)和困惑度(12.85)。一种可能的解释是,P5在全局聚合之前为所有三个注意力输入提供了局部上下文;目前的消融实验确立了经验上的排序,但并未分离出这一机制。
因此,我们在后续的设计实验中使用P5,即Post-QKV位置。
### 3.3比较卷积模块设计
参见图注图3:四种Conv1D模块设计。从左到右:普通卷积、带短路的卷积、带预归一化的卷积、带夹层归一化的卷积。#### 模块设计。
我们首先比较深度可分离卷积模块的四种内部配置(图3 (https://arxiv.org/html/2607.18413#S3.F3)):\(1\)普通卷积,Y=Conv\(X\)Y=\operatorname\{Conv\}\(X\);\(2\)带短路的卷积,Y=X\+Conv\(X\)Y=X\+\operatorname\{Conv\}\(X\);\(3\)带预归一化的卷积,Y=X\+Conv\(Norm\(X\)\)Y=X\+\operatorname\{Conv\}\(\operatorname\{Norm\}\(X\)\);\(4\)带夹层归一化的卷积,Y=X\+Norm\(Conv\(Norm\(X\)\)\)Y=X\+\operatorname\{Norm\}\(\operatorname\{Conv\}\(\operatorname\{Norm\}\(X\)\)\)。
表2:Conv1D模块设计对Qwen3-1.7B的影响。所有四种卷积变体在表2 (https://arxiv.org/html/2607.18413#S3.T2)中都优于“无Conv1D”基线,平均损失和困惑度均有改善。
Conv + Shortcut配置给出了报告的最低困惑度12.79。短路保留了投影后的QKV特征,并允许卷积学习残差的局部校正。
添加归一化并没有改善这一结果:预归一化得到12.94的困惑度,夹层归一化得到13.33。由于块已经对其输入进行了归一化,在Post-QKV阶段添加额外的归一化可能会改变注意力所使用的特征尺度。因此,我们在后续实验中保留更简单的Conv + Shortcut设计。
### 3.4配置消融
表3:核大小对Qwen3-1.7B的影响。#### 核大小。
我们在Post-QKV位置比较k∈\{2,3,4\}k\in\{2,3,4\}的深度可分离卷积。如表3 (https://arxiv.org/html/2607.18413#S3.T3)所示,所有三种设置都优于基线,k=3k=3给出了报告的最低困惑度12.79。将核大小增加到k=4k=4并未带来进一步的改善。这一结果与紧凑核足以进行短程组合的假设一致,尽管消融实验并未确定为什么k=3k=3表现最佳。我们在后续实验中使用k=3k=3。
#### 初始化。
表4:Conv1D初始化对Qwen3-1.7B的影响。“随机”表示从N\(0,0.02\)\mathcal\{N\}\(0,0.02\)采样权重或偏置。表4 (https://arxiv.org/html/2607.18413#S3.T4)比较了四种初始化设置。权重和偏置都随机初始化给出了报告的最低损失和困惑度。无偏置、零权重的设置表现明显较差,而带零或随机偏置的零权重设置则没有表现出同样的退化。我们在后续实验中对权重和偏置都使用随机初始化。
### 3.5额外的架构变体
在选择位置、模块设计、核大小和初始化之后,我们测试了三个额外的选择:第二个卷积、非线性激活函数和多分支重参数化。没有一项能在损失和困惑度两方面都优于所选配置。
表5:在P5、P17或两个位置使用Conv1D的Qwen3-1.7B结果。#### 多个卷积模块。
我们在选定的P5配置基础上,在P17处添加第二个Conv1D模块。如表5 (https://arxiv.org/html/2607.18413#S3.T5)所示,此变体略微增加了损失和困惑度。结果可能反映了注意力后的冗余局部混合以及FFN,但消融实验仅确定在此设置下添加P17没有益处。因此,我们保留在P5处单个卷积。相似文章
将循环深度改造进预训练语言模型:两种参数预算下的安装、外推、迁移与保持
本文探索了如何以微创方式将循环深度改造进预训练语言模型(如Qwen2.5-0.5B),证明所得模型能够执行更深的潜在推理,外推到受监督深度之外,并优于为在token中推理而微调的稠密模型,同时也揭示了灾难性干扰的极限。
内存高效型循环Transformer:循环语言模型中的计算与内存解耦
提出内存高效型循环Transformer(MELT),这是一种新型循环大语言模型架构,通过跨循环共享单一KV缓存,并结合插值过渡与注意力对齐蒸馏的分块训练方法,实现了推理深度与内存消耗的解耦。
理解在早期完成:大型语言模型中的深度分工及其用于无界上下文记忆
本文介绍了CoMem,一种利用LLM中深度方向分工的方法,它缓存中间残差张量,并且仅重新计算上层以进行检索,从而实现有界的读取计算和内存,与存储的上下文长度无关。在Qwen3-8B上评估,CoMem在长上下文任务上取得了强劲性能,同时显著节省内存并加速预填充。
利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理
本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。
理解大型语言模型
本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。