归纳头插值N-grams
摘要
本文研究了在马尔可夫链上训练的Transformer,发现归纳头实现了软上下文匹配和狄利克雷风格平滑,表明Transformer对上下文内估计进行正则化,而不是简单地统计n-gram。
arXiv:2607.02800v1 Announce Type: new
摘要:归纳头是被认为构成Transformer上下文内学习基础的注意力回路,然而对其所实现估计器的精确刻画仍然难以捉摸。我们研究了在阶$k$马尔可夫链上训练的Transformer,并识别出两种互补的平滑机制。首先,在有限注意力权重尺度下,该回路实现了一个软上下文匹配估计器:它聚合来自精确和部分上下文匹配的贡献,按其重叠程度指数加权,并诱导出类似于Jelinek-Mercer平滑的上下文阶之间数据依赖的插值。其次,一个序列开始(BOS)标记引入加性伪计数,恢复了狄利克雷风格平滑。我们构建了一个分离的Transformer来实现这两种机制,并展示了训练后的Transformer恢复出预测的注意力模式。在伪计数平滑最优或低阶上下文提供结构化证据的场景中,训练后的Transformer匹配或超越了经典的基于计数的基线。我们的结果将归纳头的机制可解释性与经典统计平滑联系起来,揭示了Transformer学习的是对上下文内估计进行正则化,而不是简单地计数。
查看缓存全文
缓存时间: 2026/07/07 04:39
# 归纳头插值N元语法 来源:https://arxiv.org/abs/2607.02800 查看PDF (https://arxiv.org/pdf/2607.02800) > 摘要:归纳头被认为是在Transformer中支撑上下文学习的注意力回路,然而它们所实现估计器的精确表征仍然难以捉摸。我们研究在$k$阶马尔可夫链上训练的Transformer,并识别出两种互补的平滑机制。首先,在有限的注意力权重尺度下,该回路实现了一个软上下文匹配估计器:它聚合来自精确和部分上下文匹配的贡献,这些贡献按其重叠程度呈指数加权,并诱导出类似于杰利内克-默瑟平滑的、跨上下文阶数的数据依赖插值。其次,句首(BOS)标记引入了可加性伪计数,恢复了狄利克雷风格的平滑。我们构建了一个解耦的Transformer来实现这两种机制,并表明训练后的Transformer恢复了预测的注意力模式。在伪计数平滑最优或低阶上下文提供结构化证据的各种设置中,训练后的Transformer匹配或超越了经典基于计数的基线。我们的结果将归纳头的机械可解释性与经典统计平滑相连接,揭示了Transformer学习如何在上下文估计中进行正则化,而不仅仅是计数。 ## 提交历史 来自:Francesco D'Angelo [查看邮件 (https://arxiv.org/show-email/bdc7f83e/2607.02800)] **[v1]** 2026年7月2日星期四 22:19:26 UTC (1,477 KB)
相似文章
在词元级别上比较Transformer和混合模型
本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。
现代 Transformer 是隐式的混合体:从功能分化到原则性混合架构设计
本文提出了基于干预的指标,以区分 RoPE Transformer 中的检索头和位置头,从而推导出一种原则性混合架构 (HwH),该架构结合了全注意力和线性注意力,以改善语言建模和长上下文外推。
@_albertgu:Transformer 更擅长复制,而 RNN 更擅长建模“承载意义的词——名词、动词和形容词……”
来自 Ai2 的一篇讨论比较了 transformer(Olmo 3)和混合模型(Olmo Hybrid),发现 transformer 在复制方面表现出色,而 RNN 在建模承载意义的词汇上更胜一筹,凸显了混合架构日益增长的可行性。
@TeachTheMachine: 使用Transformer模型:从训练到推理
本教程介绍如何使用Transformer模型,从训练到推理,重点讲解自回归生成、prefill(预填充)与decode(解码)阶段,以及用于高效推理的键值缓存。
当不规则性有所帮助:神经形态学中归纳偏置的子类分析
本文研究了字符级Transformer模型如何泛化到日语过去时屈折中的不规则动词子类型。控制实验表明,包含不规则示例可以改善泛化,挑战了规则性简化学习的假设。