内核中的幽灵:通过领域泛化实现高效Transformer的上下文学习

arXiv cs.LG 论文

摘要

本文从理论上分析了领域泛化下线性Transformer的上下文学习,建立了与维度无关的收敛速率,并提出了用于线性化预训练softmax大语言模型的新型激活和损失设计。

arXiv:2607.00479v1 公告类型:新 摘要:基于Transformer的大模型通过利用上下文感知的注意力模块进行上下文学习,在不同任务中展现了出色的泛化能力。随着上下文更丰富,Transformer能够更有效地适应当前用例,无需任何参数更新。然而,在softmax Transformer中,相对于上下文长度的二次计算和内存复杂度显著降低了数据处理速度。线性Transformer被提出来解决这个问题,将复杂度降低为与上下文长度呈线性关系,但从理论角度来看,线性注意力中特征映射的设计和理解仍不明确。在本文中,我们研究了在领域泛化的两阶段采样过程中线性Transformer的逼近和泛化能力。我们证明线性Transformer的上下文学习本质上是学习从上下文分布到响应函数的映射。我们的泛化分析得到了一个与维度无关的收敛速率,同时也揭示了数据分布规律性与潜在特征之间的权衡。在我们的理论框架指导下,我们提出了线性化预训练softmax大语言模型的激活和损失设计的新视角。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:38

# 内核中的幽灵:通过领域泛化实现高效Transformer的上下文学习
来源:https://arxiv.org/abs/2607.00479
查看PDF(https://arxiv.org/pdf/2607.00479)

> **摘要:**基于Transformer的大型模型通过利用上下文感知的注意力模块进行上下文学习,在不同任务上展现出了卓越的泛化能力。随着上下文信息的丰富,Transformer无需任何参数更新即可更有效地适应当前使用场景。然而,softmax Transformer在处理数据时,其计算和内存复杂度与上下文长度呈二次关系,这严重拖慢了处理速度。线性Transformer通过将复杂度降低为与上下文长度呈线性关系来解决这一问题,但从理论角度来看,线性注意力中特征映射的设计与理解仍不明确。本文从领域泛化的两阶段采样过程出发,研究了线性Transformer的近似与泛化能力。我们证明,线性Transformer的上下文学习本质上是学习从上下文分布到响应函数的映射。在泛化分析中,我们得到了一个与维度无关的收敛速率,该速率也体现了数据分布规律性与潜在特征之间的权衡。基于我们的理论框架,我们提出了对预训练softmax大语言模型进行线性化处理时激活函数与损失函数设计的新视角。

## 提交历史

来自:Peilin Liu \[查看邮箱(https://arxiv.org/show-email/ce7444e3/2607.00479)\] **\[v1\]** 2026年7月1日星期三 06:03:14 UTC(628 KB)

相似文章

变分线性注意力:用于长上下文 Transformer 的稳定联想记忆

arXiv cs.LG

本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。