超越序列顺序:面向Transformer的句法感知位置嵌入
摘要
本文介绍了SiPE,一种轻量级方法,将依存句法分析中的句法先验注入Transformer位置嵌入,在不增加推理成本的情况下,提升句法泛化能力(在SyntaxGym上最高提升10.3%)和语言理解能力(在GLUE上最高提升8.2%)。
查看缓存全文
缓存时间: 2026/08/12 08:21
论文页面 - 超越序列顺序:用于 Transformer 的句法感知位置嵌入
来源:https://huggingface.co/papers/2608.06111
摘要
SiPE 将来自依存句法分析的轻量级句法先验集成到各类 Transformer 架构的位置嵌入中,在不改变自注意力或增加推理成本的情况下,提升了句法泛化能力和语言理解能力。
位置嵌入(PE)在 Transformer 中编码了标记之间的距离与顺序,但在很大程度上与句法结构无关。我们引入了 Syntax-informed Positional Embeddings(SiPE),它在预训练期间从依存句法分析中学习一个轻量级句法先验,并将其注入到所有三种主流 PE 家族(绝对、相对、旋转)中,适用于编码器和解码器,同时保持自注意力和其余架构部分不变。我们厘清了先验应以何种方式在何处进入模型,并发现这取决于架构:对于使用相对 PE 的自回归解码器,先验与注意力分数的相对位置项以乘法方式耦合时效果最强,优于注入输入嵌入、注入自注意力或同时注入位置项与注意力项的做法;而对于编码器,最好直接加到输入嵌入中,与各编码器原生的位置机制组合使用。我们发现,使用 SiPE 预训练的模型在 SyntaxGym 基准上最多提升 10.3%,同时[困惑度](https://huggingface.co/papers?
相似文章
Position Encoding in Transformers: From Absolute and Relative Methods to Rotary Position Embeddings and Long-Context Scaling
A technical survey on position encoding methods in Transformers, covering absolute and relative methods, RoPE, and long-context scaling techniques like Position Interpolation, NTK-aware scaling, YaRN, and LongRoPE.
通过层特定位置嵌入缩放缓解Transformer中的位置偏差
介绍LPES,一种层特定位置嵌入缩放方法,通过使用贝塞尔曲线的遗传算法为每层分配不同的缩放因子,缓解LLM中的“中间丢失”问题,无需微调或增加延迟即可实现高达11.2%的准确率提升。
通过相对位置编码对距离进行编码以增强基于Transformer的路由
本文探讨了在Transformer架构中使用相对位置编码(RPE)作为加性偏置来解决团队定向问题,与原始Transformer架构相比,在收集奖励和最优性差距方面展示了一致的改进。
RoPE在长上下文中既不能区分位置也不能区分标记,可证明
本文提供了理论证明,表明基于Transformer的语言模型中的旋转位置嵌入(RoPE)在长上下文中会失去其局部性偏差和区分标记顺序的能力,注意力分数变得不比随机更好。作者证明,增加RoPE基频会在位置区分和标记区分之间进行权衡,且多头、多层架构无法弥补这一基本限制。
GiLT:利用依存图增强Transformer语言模型
论文提出了GiLT(Graph-Infused Layers Transformer Language Model),它通过在token预测过程中增量构建的依存图特征来调整注意力权重,从而改善句法泛化能力,在保持竞争性困惑度的同时超越基线模型。