语法的演变几何:Transformer层间的维度与邻域重组
摘要
本文研究了词元的语法角色如何影响Transformer表示的几何结构在各层中的变化,发现编码器和解码器模型中存在不同的演化模式。
arXiv:2608.25166v1 公告类型:新
摘要:Transformer表示描述了在高维向量空间中的轨迹,随着词元在各层中整合关系上下文,这些轨迹被动态塑造。此类数据倾向于集中在低维子流形上,这是一种通过内在维度(ID)量化的压缩形式,即在没有显著信息损失的情况下表示它们所需的最小独立变量数。在这项工作中,我们探讨词元的语法角色(由其词性(PoS)标签标记)是否塑造了该流形的局部几何结构。为此:(1)我们研究了ID的逐层演化,发现封闭类词项比开放类词项更早扩展并更早收缩;(2)我们展示其扩展和收缩可由邻域结构的变化来解释,从而反映句子内词与词之间关系的变化;(3)我们比较了编码器(ModernBERT, bigbird-roberta-large)和解码器(gemma-2-2B, Llama-3.2-3B),发现这两类模型在各层中的演化方式不同,与它们整合上下文的方式一致;(4)我们表明仅几何特征就能恢复词元的语法角色,并用它们来解释每个PoS的语义内容在下游分类任务中如何在各层间演化。
查看缓存全文
缓存时间: 2026/08/27 09:16
# 语法几何的变迁:Transformer各层间的维度与邻域重组 来源:https://arxiv.org/abs/2608.25166 查看PDF (https://arxiv.org/pdf/2608.25166) > 摘要:Transformer的表征描述了在高维向量空间中的轨迹,这些轨迹随着标记(token)在各层中整合关系语境而动态形成。此类数据倾向于集中于低维子流形,这是一种可通过**本征维度**(Intrinsic Dimensionality, ID)量化的压缩形式——即在不造成显著信息损失的情况下表示数据所需的最小独立变量数。本研究探究了由词性(Part-of-Speech, PoS)标记所指示的标记语法角色,是否会塑造该流形的局部几何结构。为此:(1)我们研究了ID的逐层演变,发现封闭类词项比开放类词项更早扩展并更早坍缩;(2)我们揭示其扩展与收缩可由邻域结构的变化——即句子内词语间关系的变化——来解释;(3)我们对比了编码器(ModernBERT、bigbird-roberta-large)与解码器(gemma-2-2B、Llama-3.2-3B),发现两类模型在各层间演化方式不同,这与其上下文整合方式一致;(4)我们表明仅凭几何特征即可恢复标记的语法角色,并利用这些特征解释在下游分类任务中各词性的语义内容如何在各层间演变。 ## 提交历史 来自:Federico Ravenda \[查看邮件 (https://arxiv.org/show-email/b90e13cf/2608.25166)\] **\[v1\]**2026年8月25日 星期二 21:27:21 UTC(4,586 KB)
相似文章
Transformer残差流中的几何与行为分层
本文研究了训练后Transformer的残差流几何结构,表明预测方向作为一个特权锚点,将残差流的变化分为狭窄的、与读出相关的区域和宽广的计算区域,这一现象在18个模型中均成立。这些发现对可解释性和评估具有启示意义。
语义空间的几何:Transformer架构的连续几何框架
提出一个连续几何框架,将Transformer操作建模为语义纤维丛上的积分-微分方程,并在多种架构上进行了验证。
基于有界深度文法的深度Transformer层次建模表达性分析
本文对深度Transformer使用有界深度上下文无关文法建模层次结构的能力进行了理论分析,构建了显式的位置注意力Transformer,将文法状态编码到线性可分的子空间中。
跨Transformer深度的残差流几何分析
本文提出了一种跨深度的Transformer残差流几何分析方法,利用相对位移和正交普鲁克分析,揭示了六个指令调优模型在代码生成和翻译任务中的结构化规律。
LoRA适配器的特征几何:微调语言模型中表征差异的稀疏自编码器分析
本文使用稀疏自编码器分析了语言模型中LoRA诱导表征的几何结构,发现LoRA更新占据的部分特征结构无法完全被预训练的可解释性词典捕获。