Transformer模型中的词汇抽象泛化:功能词的案例

arXiv cs.CL 论文

摘要

本文探讨了Transformer模型如何处理如代词和副词等功能词,分析了它们的嵌入表示和泛化能力。研究发现,在混合使用词汇化和功能句进行训练时,模型能学习到共享的句法-语义结构。

arXiv:2609.19887v1 Announce Type: new 摘要:代词、副词和其他功能词(如 they, her, somewhere, there)常在语言中用来替代具体名词或短语,当它们的属性——如性别、语法数——为给定上下文提供足够信息时。预训练的Transformer模型是否以一种允许它们像人类一样使用的方式来编码这些功能词?语言模型能否识别诸如“研究人员写了论文”和“他们写了它”这类句子的句法和语义平行性,这依赖于此类词汇抽象? 我们将这些语言学问题映射到预训练Transformer模型的嵌入空间中,比较名词的表示与可以替代这些名词的代词和副词的表示,在独立情况下以及在平行词汇化和功能句中。然后我们探测平行词汇化和功能句嵌入中的共享句法和语义结构。 我们发现,与名词相比,功能词位于中心位置,但又有所不同,这与它们在各种上下文中作为占位符的行为一致。 对平行(词汇化和功能)句子嵌入的分析显示它们占据了嵌入空间的不同子空间。提炼句子结构信息的实验表明,仅使用任一类型的数据进行训练无法揭示共享结构——因为功能数据中词汇过度一致,而词汇化版本中则过于多样化。然而,使用功能句和词汇化句的混合训练,共享结构得以显现。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:06

# Transformer模型中通过词汇抽象实现的泛化:以功能词为例  
来源:https://arxiv.org/html/2609.19887  
Giuseppe Samo  
Vivi Nastase  
机构:Idiap Research Institute,瑞士马尔蒂尼  
邮箱:[vivi\.a\.nastase@gmail\.com](mailto:)  
Paola Merlo  
机构:Idiap Research Institute,瑞士马尔蒂尼;日内瓦大学,瑞士  
邮箱:[Paola\.Merlo@unige\.ch](mailto:)  

###### 摘要  
代词、副词及其他功能词(如they、her、somewhere、there)常在语言中替代具体名词或短语,其语法属性(如性、数)能在特定语境中提供充分信息。预训练Transformer模型是否以类似人类的方式编码这些功能词,使其能被正确使用?语言模型能否识别如“研究人员撰写了论文”和“They wrote it”这类句子在语法与语义上的平行性——这种平行性依赖于词汇抽象?我们将这些语言学问题映射到预训练Transformer模型的嵌入空间中,通过分析独立词汇及平行句式中(包含具体词汇与功能词)的名词、代词和副词的表征,比较名词与可替代它们的代词/副词的表征差异。进一步探索平行句式(词汇化与功能词版本)嵌入中的共享句法语义结构。研究发现:功能词相比名词处于嵌入空间的中心位置,同时又保持独立性,这与其在广泛语境中作为占位符的行为一致。对平行句式的嵌入分析显示,它们占据嵌入空间的不同子区域。通过蒸馏句子结构信息的实验表明,仅使用单一类型数据训练无法揭示共享结构——功能词数据因词汇高度一致,而词汇化数据因变体过多。但混合使用两类数据训练后,共享结构得以显现。  

## 1 引言  
基础语言模型的成功很大程度上源于其生成词或标记表征的能力,这些表征编码了极其复杂的语言数据及其多重生成因素(Bengio et al., 2013)。理解这些表征所编码的语言信息以及模型如何成功操纵它们以解决各类任务,始终是学界探索的方向。然而,模型在多项语言与NLP任务上的高性能,很难完全归因于其对语言及其结构的“理解”(Waldis et al., 2024)。判断模型语言理解程度的标准之一是其“泛化”能力。该问题常从技术而非语言学视角切入——泛化被视为学习模型的关键属性,能确保其在训练环境外部署时的可靠性,无论应用涉及微小任务差异、分布外数据、不同语言,还是应用领域与训练环境之间的其他层面区分(Hupkes et al., 2023)。  

本文聚焦语言泛化与抽象。例如,说话者能轻松将句子提炼为基础句法-语义结构,如“谁对谁做了什么”“她把那东西放在那里”或“她有时那样做”。使用代词或副词将句子简化为“骨架”并不依赖词汇表外词汇——代词和副词语(如somewhere/sometime)是语料库中最高频的词语,且频繁出现在共指表达中,证实了它们在共享语境中的普遍性。语义学中,代词形式通常被视为变量,是句子内更结构化词汇元素的占位符,因而具有高度抽象性(Büring, 2019)。功能词作为名词和介词短语的抽象占位符这一特性,是否被语言模型捕捉?  

我们将此问题映射到预训练Transformer模型(PTM)的嵌入空间。嵌入空间基于“词语相似性与关联性等同于空间邻近性”的假设构建。作为抽象占位符,功能词与多样化的名词及介词短语共享语境,因而与它们存在一定程度的相似性。我们预期其位于嵌入空间中心区域,从而能接近各类名词与介词短语。在句子嵌入空间中,我们测试平行句(如“The researchers wrote the paper”与“They wrote it”)是否因共享句法属性(句子结构与短语类型)和语义属性(语义角色及角色填充者的特性)而在空间中邻近。若PTM捕捉了语言抽象,这种共享信息——句法结构和语义角色——应以相似方式编码,无论短语包含名词还是功能词。  

我们通过专为使役动词交替现象设计的数据集检验上述假设,该数据集包含多层次结构与词汇变化。我们提取多种格式数据,以探索孤立词与语境词、功能词版本与词汇化版本句子的表征。观察发现:功能词相比名词位于嵌入空间中心位置,同时保持独立性,这与其作为广泛语境中占位符的行为预期相符。对句子嵌入的分析显示,功能词版本与词汇化版本占据嵌入空间的不同区域。按常用余弦距离度量的几何关系,这表明两类句子版本相似度较低。然而,若将句子嵌入视为复杂对象,我们能检测到其以相似方式编码的共享句法-语义结构。  

## 2 数据  
动词交替要求观察至少两个相关句子。它揭示同一动词如何在不同句法语境中出现,并通过跨句子的论元系统性句法-语义映射(如同共享变量绑定的方程组)实现交替。数据集(Samo, 2025)源于Levin(1993)提出的两类动词:状态变化类(COS)与宾语省略类(OD)。这两类动词提供了论元结构最小对立对:共享相同句法结构(及物/不及物交替),但论元结构不同。COS类及物动词的宾语与不及物动词的主语共享同一语义角色(受事),如“The artist opens this door/This door opens”。及物形式具有使役含义。相反,OD类动词在主宾语交替中保持主语的同一语义角色(施事),且动词无使役义(Levin, 1993;Merlo and Stevenson, 2001)。  

我们将词汇分为词汇词与功能词。词汇词(内容词)为开放类,具有实在意义,对应世界概念、实体或事件。功能词(封闭类)则表达语法功能。本文具体关注代词及部分可表达时空概念的副词。这些功能词可作为名词和介词短语的通用占位符:例如,“The researchers wrote the article last week”可抽象表达为“They wrote it then”。  

### 2.1 数据模板  
数据集遵循Blackbird语言矩阵(BLM)框架(Merlo, 2023)。每个实例为多选谜题,由(i)规则生成的上下文句子序列(展示所编码现象)和(ii)最小差异对比答案集(一个正确,其余违反子规则)构成。规则包含两类:描述所研究语言属性(动词交替)的规则,以及与之无关的规则(如介词短语的有无)。上下文集的构建基于动词交替的句法-语义特征及其组合规则:(i)一个或两个论元的存在性及其属性(施事Ag/受事Pat);(ii)动词的主动态(Akt)或被动态(Pass)。现象外部因素包括:(i)任何介词引入的NP(如in an instant,后称p-NP)与(ii)by介词引入的NP(如by chance,后称by-NP)之间的交替,但非施事性by短语(如by the artist, by-Ag/by-Pat)保持为混淆变量。OD上下文与COS的最小差异在于最后一句:不及物动词的主语为施事而非受事。  

所有答案结构相同:(NP V by-NP),包含动词、两个名词性成分(构成NP V NP结构)及动词与第二个NP间的介词(by或无介词)。候选答案包括符合BLM规则的正确不及物形式及by-NP,以及通过破坏规则属性获得的对比性错误答案(错误论元、错误动词语态、缺少介词、PP中错误名词性成分)。错误类型包括:第一成分语义角色错误(SSM)、by引入的末尾成分错误(WrBy),其余错误按生成结构标注(不及物Intr/及物Trans/被动态Pass)。答案集在动词类间保持不变,仅正确答案标签不同:COS的正确答案对应OD的错误,反之亦然。COS与OD的BLM模板(上下文与答案)如图1所示。  

图1:BLM的COS与OD上下文及答案  

### 2.2 词汇抽象层级  
为探索通过抽象实现泛化,我们生成两类主要数据变体:词汇化版本(标注为Lex)与功能词版本(标注为Fun,除主要动词外所有内容词由功能词替代)。词汇化版本进一步细分为三类(I/II/III型),具有不同程度的词汇化,以便与功能词的小规模词库对比。各组示例见图2及相关生成流程说明。附录图8与图9提供了两类动词的I型数据示例。  

图2:三级词汇变化(I/II/III型)的生成过程,以COS数据为例  

I型数据包含词汇一致性高的实例,上下文与答案集间变化最小。II型数据中动词保持不变,但某一成分在上下文与答案集间变化。III型数据在上下文句子与答案集中均呈现最大词汇多样性。  

### 2.3 主数据集  
主数据集基于Levin(1993)中两类动词各三十个(人工选择)构建。完整列表见附录表2。功能词库由作者手工选择以保持句子句法语义可接受性(Haspelmath, 1997的讨论)。词汇替代项由掩码语言模型(bert-base-uncased, Devlin et al. 2018)提供。模型接收仅包含掩码成分、动词及功能词的句子。例如,为获取动词break的论元,使用两个掩码模板:受事被掩码且施事为代词形式(如she broke (the/a/some/...)),以及及物主语被掩码且受事为代词(如(the/a/some/...) broke it)。词汇种子与功能种子均包含每个论元类别(Ag、Pat、p-NP、by-NP)的五个语义合理实例。我们确保了动词屈折中时态与数的均衡分布。实验中,我们从38400种论元与动词组合中采样3000个实例(每种类型),经半自动构建与人工合理性、语法性评估。  

### 2.4 数据集变体  
基于上述主数据集,我们构建用于不同实验的多个变体。  

#### 词汇  
从BLM数据集I型子集的每个句子中提取功能词及其对应的名词与介词短语。共包含17个功能词/短语(he, her, him, it, she, somebody, someone, that, that one, them, these, these ones, they, this, this one, those, those ones)与204个名词短语。  

#### 句子  
从BLM数据集I型的Fun与Lex子集中,编制平行版本的词汇化与功能词句子。每个句子标注其句法模式(对应图1句法-语义模板的句法版本,如Pron Vpass PP PP)。从中采样4000句,按80:20划分训练集与测试集,训练数据的10%用作验证集。  

#### BLM数据  
从三十个动词中,选取三个动词(3×100实例)的所有实例用于测试。其余27个动词的实例中,随机采样2000个用于训练。训练数据的10%动态选择为验证集。所有Fun/Lex与I/II/III型变体均采用此27:3的动词划分。各变体训练集均为2000实例,测试集300实例。我们还制作了合并COS与OD子任务的变体,其训练/测试数据划分方式类似。  

## 3 分析与实验  
我们旨在确定语言模型是否编码了代词和副词相对于名词及名词短语的词汇抽象特性。我们将此问题转化为对词汇与句子嵌入空间的分析,并分步骤进行。我们研究在相似句子语境中呈现时,词汇词与功能词嵌入的相对位置,以及平行句式(词汇化与功能词版本)嵌入中的共享结构。

相似文章

语言模型框架是组合性泛化器(49分钟阅读)

TLDR AI

这篇博客文章认为,语言模型中更好的泛化应来自'框架'(即接口程序),而非仅仅扩展训练数据。实验表明,递归语言模型框架能够实现远超基础Transformer的长度和领域泛化。