超越序列顺序:面向Transformer的句法感知位置嵌入

Hugging Face Daily Papers 论文

摘要

本文介绍了SiPE,一种轻量级方法,将依存句法分析中的句法先验注入Transformer位置嵌入,在不增加推理成本的情况下,提升句法泛化能力(在SyntaxGym上最高提升10.3%)和语言理解能力(在GLUE上最高提升8.2%)。

Transformer中的位置嵌入(PE)编码了词元距离与顺序,但在很大程度上不感知句法结构。我们提出了句法感知位置嵌入(SiPE),它在预训练期间从依存句法分析中学习轻量级句法先验,并将其注入所有三种主流PE族(绝对、相对、旋转),同时适用于编码器和解码器,且不改变自注意力机制及架构其余部分。我们剖析了先验应进入模型的位置与方式,并发现这取决于架构:对于使用相对PE的自回归解码器,当先验与注意力分数中的相对位置项以乘法方式耦合时效果最强,优于注入输入嵌入、注入自注意力,或同时注入位置项与注意力项;而对于编码器,最佳方式是直接加到输入嵌入上,与各编码器自身的原生位置机制组合。我们发现,使用SiPE预训练的模型在SyntaxGym基准上最高提升10.3%,同时与没有句法监督的基础模型相比困惑度降低9.0%——而几乎所有现有的句法注入方法反而会使这一指标恶化。关键在于,这些收益不仅限于句法泛化:SiPE还提升了现实世界语言理解能力,在GLUE基准上的得分比未使用SiPE训练的模型最高提升8.2%。与现有在推理时对多个句法树进行边缘化或在运行时丢弃句法的句法语言模型不同,SiPE仅基于单个句法树进行条件建模,从而在句法监督与推理成本之间建立了新的帕累托前沿。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:21

论文页面 - 超越序列顺序:用于 Transformer 的句法感知位置嵌入

来源:https://huggingface.co/papers/2608.06111

摘要

SiPE 将来自依存句法分析的轻量级句法先验集成到各类 Transformer 架构的位置嵌入中,在不改变自注意力或增加推理成本的情况下,提升了句法泛化能力和语言理解能力。

位置嵌入(PE)在 Transformer 中编码了标记之间的距离与顺序,但在很大程度上与句法结构无关。我们引入了 Syntax-informed Positional EmbeddingsSiPE),它在预训练期间从依存句法分析中学习一个轻量级句法先验,并将其注入到所有三种主流 PE 家族(绝对、相对、旋转)中,适用于编码器和解码器,同时保持自注意力和其余架构部分不变。我们厘清了先验应以何种方式在何处进入模型,并发现这取决于架构:对于使用相对 PE 的自回归解码器,先验与注意力分数的相对位置项以乘法方式耦合时效果最强,优于注入输入嵌入、注入自注意力或同时注入位置项与注意力项的做法;而对于编码器,最好直接加到输入嵌入中,与各编码器原生的位置机制组合使用。我们发现,使用 SiPE 预训练的模型在 SyntaxGym 基准上最多提升 10.3%,同时[困惑度](https://huggingface.co/papers?

相似文章

RoPE在长上下文中既不能区分位置也不能区分标记,可证明

arXiv cs.CL

本文提供了理论证明,表明基于Transformer的语言模型中的旋转位置嵌入(RoPE)在长上下文中会失去其局部性偏差和区分标记顺序的能力,注意力分数变得不比随机更好。作者证明,增加RoPE基频会在位置区分和标记区分之间进行权衡,且多头、多层架构无法弥补这一基本限制。

GiLT:利用依存图增强Transformer语言模型

arXiv cs.CL

论文提出了GiLT(Graph-Infused Layers Transformer Language Model),它通过在token预测过程中增量构建的依存图特征来调整注意力权重,从而改善句法泛化能力,在保持竞争性困惑度的同时超越基线模型。