内核中的幽灵:通过领域泛化实现高效Transformer的上下文学习
摘要
本文从理论上分析了领域泛化下线性Transformer的上下文学习,建立了与维度无关的收敛速率,并提出了用于线性化预训练softmax大语言模型的新型激活和损失设计。
arXiv:2607.00479v1 公告类型:新
摘要:基于Transformer的大模型通过利用上下文感知的注意力模块进行上下文学习,在不同任务中展现了出色的泛化能力。随着上下文更丰富,Transformer能够更有效地适应当前用例,无需任何参数更新。然而,在softmax Transformer中,相对于上下文长度的二次计算和内存复杂度显著降低了数据处理速度。线性Transformer被提出来解决这个问题,将复杂度降低为与上下文长度呈线性关系,但从理论角度来看,线性注意力中特征映射的设计和理解仍不明确。在本文中,我们研究了在领域泛化的两阶段采样过程中线性Transformer的逼近和泛化能力。我们证明线性Transformer的上下文学习本质上是学习从上下文分布到响应函数的映射。我们的泛化分析得到了一个与维度无关的收敛速率,同时也揭示了数据分布规律性与潜在特征之间的权衡。在我们的理论框架指导下,我们提出了线性化预训练softmax大语言模型的激活和损失设计的新视角。
查看缓存全文
缓存时间: 2026/07/02 05:38
# 内核中的幽灵:通过领域泛化实现高效Transformer的上下文学习 来源:https://arxiv.org/abs/2607.00479 查看PDF(https://arxiv.org/pdf/2607.00479) > **摘要:**基于Transformer的大型模型通过利用上下文感知的注意力模块进行上下文学习,在不同任务上展现出了卓越的泛化能力。随着上下文信息的丰富,Transformer无需任何参数更新即可更有效地适应当前使用场景。然而,softmax Transformer在处理数据时,其计算和内存复杂度与上下文长度呈二次关系,这严重拖慢了处理速度。线性Transformer通过将复杂度降低为与上下文长度呈线性关系来解决这一问题,但从理论角度来看,线性注意力中特征映射的设计与理解仍不明确。本文从领域泛化的两阶段采样过程出发,研究了线性Transformer的近似与泛化能力。我们证明,线性Transformer的上下文学习本质上是学习从上下文分布到响应函数的映射。在泛化分析中,我们得到了一个与维度无关的收敛速率,该速率也体现了数据分布规律性与潜在特征之间的权衡。基于我们的理论框架,我们提出了对预训练softmax大语言模型进行线性化处理时激活函数与损失函数设计的新视角。 ## 提交历史 来自:Peilin Liu \[查看邮箱(https://arxiv.org/show-email/ce7444e3/2607.00479)\] **\[v1\]** 2026年7月1日星期三 06:03:14 UTC(628 KB)
相似文章
理解边缘:稀疏自编码器追踪Transformer泛化的界限
本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。
使用线性自注意力Transformer对简单线性回归任务的闭式解进行上下文学习
本文构造了一个具有线性自注意力的Transformer,该Transformer对简单线性回归执行闭式最小二乘解的上下文学习,利用层归一化来近似解析解,而非梯度下降。
内存高效型循环Transformer:循环语言模型中的计算与内存解耦
提出内存高效型循环Transformer(MELT),这是一种新型循环大语言模型架构,通过跨循环共享单一KV缓存,并结合插值过渡与注意力对齐蒸馏的分块训练方法,实现了推理深度与内存消耗的解耦。
变分线性注意力:用于长上下文 Transformer 的稳定联想记忆
本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。
@a1zhang: Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,它…
文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。