POSPAN: 位置约束跨度掩码用于语言模型预训练

arXiv cs.LG 论文

摘要

POSPAN 引入了一个位置约束的跨度掩码框架,统一了现有的跨度级别方法用于语言模型预训练,在 NLU 基准测试中显示出增强的性能。

arXiv:2609.16061v1 公告类型:新 摘要: 跨度级别的掩码语言建模 (MLM) 已被证明对预训练语言模型优于原始的单标记 MLM,因为实体/短语及其依赖关系对语言理解至关重要。以往的工作仅考虑跨度长度的某种离散分布,而忽略了跨度之间的依赖关系,即假设掩码跨度的位置是均匀分布的。在本文中,我们提出 POSPAN,一个通用框架,通过结合跨度长度分布和位置约束分布,允许多样化的位置约束跨度掩码策略,统一了所有现有的跨度级别掩码方法。为了验证 POSPAN 在预训练中的有效性,我们在多个 NLU 基准测试的数据集上对其进行了评估。实验结果表明,位置约束能够广泛地增强跨度级别的掩码,我们最佳的 POSPAN 设置始终优于仅跨度长度的对应方法和原始 MLM。我们还对掩码语言模型中的位置约束进行了理论分析,以阐明 POSPAN 运行良好的原因,展示了 POSPAN 的合理性和必要性。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:36

# POSPAN:用于语言模型预训练的位置约束片段掩码策略
来源:https://arxiv.org/html/2609.16061  
会议:第32届ACM国际信息与知识管理会议论文集;2023年10月21–25日;英国伯明翰  
第32届ACM国际信息与知识管理会议论文集(CIKM '23),2023年10月21–25日,英国伯明翰  
价格:15.00美元  
DOI:10.1145/3583780.3615197(https://doi.org/10.1145/3583780.3615197)  
ISBN:979-8-4007-0124-5/23/10  
ACM分类:计算方法;词汇语义学  
ACM分类:计算方法;自然语言处理  
张振宇  
注:该工作已被CIKM21短文录用。  
单位:京东人工智能研究院,中国  
邮箱:[[email protected]](mailto:[email protected])  
沈磊  
单位:京东人工智能研究院,中国  
邮箱:[[email protected]](mailto:[email protected])  
赵宇明  
单位:京东人工智能研究院,中国  
邮箱:[[email protected]](mailto:[email protected])  
陈猛  
单位:京东人工智能研究院,中国  
邮箱:[[email protected]](mailto:[email protected])  
何晓东  
单位:京东人工智能研究院,中国  
邮箱:[[email protected]](mailto:[email protected])  
© ACM许可

###### 摘要  
片段级掩码语言建模(MLM)已被证明在预训练语言模型中比原始的单token MLM更具优势,因为实体/短语及其依赖关系对于语言理解至关重要。先前的工作仅考虑片段长度服从某种离散分布,而忽略了片段之间的依赖关系,即假设掩码片段的位置是均匀分布的。本文提出了POSPAN,这是一个通用框架,通过结合片段长度分布和位置约束分布,允许多样的位置约束片段掩码策略,从而统一了所有现有的片段级掩码方法。为了验证POSPAN在预训练中的有效性,我们在多个NLU基准数据集上对其进行了评估。实验结果表明,位置约束能够广泛增强片段级掩码的效果,并且我们最佳的POSPAN设置始终优于仅使用片段长度的对应方法和标准MLM。我们还对掩码语言模型中的位置约束进行了理论分析,阐明了POSPAN效果良好的原因,展示了其合理性和必要性。

###### 关键词:掩码语言建模,预训练,片段长度分布,位置约束分布

## 1. 引言  
大规模预训练语言模型(PLMs)在许多自然语言理解(NLU)任务上取得了无与伦比的性能(Devlin等,2019;Lan等,2020;Yang等,2019;Sun等,2020)。作为最主流的模型家族之一,基于BERT的模型利用掩码语言建模(MLM)(Devlin等,2019),这是一种基于token的去噪自编码任务,来促进预训练期间的表示学习。MLM从输入文本中采样token并用特殊token “[MASK]”替换它们,然后要求模型根据被掩码token的上下文隐藏表示来重建原始token,从而使模型能够利用双向上下文捕获每个token的语义。然而,标准MLM仅考虑随机掩码单个token(词或子词),因此忽略了token层面之外的信息,例如短语的组合语义和实体的token间依赖关系,而这些是预训练中NLU的关键组成部分(Xiao等,2021)。

为了学习片段(例如短语、实体和n-gram)中的丰富语义,越来越多的研究致力于改进MLM(Cui等,2020;Xiao等,2021;Joshi等,2020;Zhang等,2021)。它们主要关注片段级掩码方法,其中根据某种离散的片段长度分布掩码一个连续的token序列(即片段),该分布的参数要么是预设的(Joshi等,2020),要么是从外部知识中自适应而来(Sun等,2020)。尽管在Joshi等(2020)中优于标准MLM,但现有的片段级掩码方法都假设掩码片段的位置是均匀分布的,即序列中的掩码片段彼此独立(Aroca-Ouellette和Rudzicz,2020)。这可能导致预训练中掩码片段的选择次优,因为自然语言的内在特征(包括语义流和片段间交互)会导致短语和实体在上下文中具有强烈的依赖性(Cui等,2020)。因此,掩码片段位置均匀分布的假设可能不是一个合适的归纳偏置;相反,与特定位置距离绑定的片段掩码可能产生更好的上下文依赖建模。

为此,我们提出了POSPAN,一个允许多样化位置约束片段掩码策略的通用片段掩码算法。POSPAN采用片段长度分布 \(F_M\) 和位置约束分布 \(F_D\) 分别控制掩码片段的长度和位置距离。此外,所有现有的片段级掩码方法都可以在POSPAN下统一,其中 \(F_M\) 不同,而 \(F_D\) 源自相同的均匀分布。为了验证POSPAN对语言理解的有效性,我们在GLUE(Wang等,2019b)和Super GLUE(Wang等,2019a)基准的多项任务上评估了使用POSPAN的PLMs。实验结果表明,当结合合适的位置约束时,POSPAN可以持续优于以前仅使用片段长度的对应方法,这也与我们的理论分析结论一致。

## 2. 方法  
### 2.1. 基于两种分布的片段掩码  
对于片段掩码,有两个重要因素:(1)片段的长度,即需要掩码多少个连续token;(2)片段的位置,即从哪里开始掩码。给定一个包含 \(m\) 个掩码片段的序列 \(S=\{S_1, S_2, ..., S_m\}\),第 \(i\) 个片段的长度和位置分别记为 \(len_i\) 和 \(pos_i\)(为简单起见,我们用 \(i\) 代表第 \(i\) 个片段 \(S_i\) 的完整符号),我们在两种分布下形式化这些因素:
\[ len_i \sim F_M, \quad |pos_{i+1} - pos_i| \sim F_D, \quad 0 \leq pos_i \leq N - len_i \]
其中 \(N\) 是序列的长度。\(F_M\) 通常是一个基于片段长度的离散概率分布,如泊松分布或几何分布,而 \(F_D\) 是一个控制片段间位置距离的分布,如均匀分布或指数分布。现有方法主要关注设计 \(F_M\),而 \(F_D\) 通常被忽略(隐式假设为均匀分布)。

### 2.2. POSPAN的理论分析  
#### 2.2.1. 潜在语义依赖性  
假设输入文本的两个片段 \(S_i\) 和 \(S_j\) 的起始位置分别为 \(i\) 和 \(j\)。\(S_i\) 中有 \(len_i = |S_i|\) 个token,\(S_j\) 中有 \(len_j = |S_j|\) 个token。片段的上下文依赖性包含了对掩码片段预测重要的丰富语义。我们使用一个潜在变量 \(R_{ij}\) 来表示 \(S_i\) 和 \(S_j\) 之间的语义依赖性。通常,自然语言中存在三种情况的 \(R_{ij}\):
- **情况1**:\(S_i\) 和 \(S_j\) 之间几乎没有依赖或语义关系,即我们可以在彼此未知的情况下独立预测 \(S_i\) 和 \(S_j\)。
- **情况2**:\(S_i \rightarrow S_j\),即 \(S_i\) 是 \(S_j\) 的前提。当 \(S_i\) 出现时,\(S_j\) 大多数时候也会出现。
- **情况3**:\(S_j \rightarrow S_i\),即 \(S_j\) 是 \(S_i\) 的前提。

引入潜在变量 \(R_{ij}\) 后,我们将片段掩码方法表示为:
\[ P(S_i, S_j | R_{ij}) = \frac{P(R_{ij} | S_i, S_j) \cdot P(S_i, S_j)}{P(R_{ij})} \]
\[ \log P(S_i, S_j | R_{ij}) \propto \underbrace{\log P(R_{ij} | S_i, S_j)}_{\textcircled{1}} + \underbrace{\log P(S_i, S_j)}_{\textcircled{2}} \]
其中 \(P(R_{ij})\) 是可以从语料库估计的先验概率,\(P(S_i, S_j)\) 是片段对概率,表示为 \(P(x_i, ..., x_{i+len_i-1}, x_j, ..., x_{j+len_j-1})\)。那么,为了最大化训练中 \(M\) 个掩码片段的对数似然,我们有:
\[ \sum_{i,j} \log P(S_i, S_j) = \frac{(M-1) \log P(S_1, S_2, ..., S_M)}{2} \propto \sum_{i=1}^{M} \log P(S_i) \]
我们定义目标函数为片段损失 \(\mathcal{L}_S\),其中片段长度 \(len_i \sim F_M\),并且“\(\rightarrow\)”表示 \(\mathcal{L}_S\) 的目标是:
\[ \mathcal{L}_S: \rightarrow \max \left( \mathbb{E}[\log P(S_i | len_i)] \right) \]
其中 \(\mathbb{E}[\log P(S_i | len_i)] = \mathbb{E}_{len_i \sim F_M} \left( \sum_{l=0}^{len_i-1} \log P(x_{i+l}) \right)\)。

公式(5)的假设是预测掩码token的概率彼此独立。\(\sum_{i,j} P(S_i, S_j)\) 表示 \(M(M-1)/2\) 个唯一的片段组合。先前的工作仅关注公式(4)中的第二项,并使用各种 \(F_M\),而忽略了由 \(F_D\) 控制的潜在语义依赖性 \(R_{ij}\)(即第一项)的影响。对于情况1,公式(4)中的第一项可以忽略不计。然而,对于情况2和情况3,公式(4)中的第一项至关重要,因为 \(F_D\) 的不当设置会损害用于自然语言理解的掩码语言模型。

#### 2.2.2. 位置约束作为先验知识  
掩码片段的预测可以通过使用片段的边界token来实现(Joshi等,2020),即 \(P(S_i)\) 可以从 \(S_i\) 的边界token估计:
\[ P(S_i) = P(x_{pos_i-1}, x_{pos_i+len_i}, pos_i) \approx P(x_{pos_i-1}, x_{pos_i+len_i}, \hat{x}_{pos_i}) \]
其中 \(pos_i\) 是 \(S_i\) 的位置。由于我们掩码了片段 \(S_i\) 中的token,掩码token \(\hat{x}_{pos_i}\) 被用来表示 \(pos_i\)。\(S_i\) 和 \(S_j\) 之间的距离依赖性由它们之间的 \(d\) 个token反映,即 \(I_{ij} = \{x_{pos_j-d}, ..., x_{pos_j-1}\}\)。然后,\(R_{ij}\) 通过下式推断:
\[ P(R_{ij} | d) = P(R_{ij} | S_i, S_j, I_{ij}) \]
我们假设在给定 \(R_{ij}\) 的情况下,\(I_{ij}\) 中未掩码的token与 \(S_i\) 和 \(S_j\) 中的token独立,那么最大化 \(P(R_{ij} | d)\) 的似然等价于优化公式(4)中的第一项:
\[ P(R_{ij} | S_i, S_j) \propto P(R_{ij} | d) \]
最终,使用掩码语言模型的预训练可以分解为两个损失:
\[ \mathcal{L} = \mathcal{L}_R + \mathcal{L}_S \]
\[ \mathcal{L}_R: \rightarrow \max \left( \mathbb{E}[\log P(R_{ij} | F_D)] \right) \]
其中 \(\mathcal{L}_S\) 是来自公式(5)的片段长度损失,\(\mathcal{L}_R\) 是片段依赖性损失。片段长度和位置约束分别由先验分布 \(F_M\) 和 \(F_D\) 控制,即 \(len_i \sim F_M\) 和 \(d \sim F_D\)。通过适当设置先验知识,我们可以提高NLU任务预训练的上限。

### 2.3. POSPAN算法  
通过组合不同的 \(F_M\) 和 \(F_D\),可以实现各种掩码策略。为了方便地研究不同掩码策略的影响,我们在算法1中展示了POSPAN的采样算法。给定一个文本序列,该算法首先采样 \(N\) 个片段长度(\(\sim F_M\))和 \(N\) 个片段间位置约束(\(\sim F_D\)),分别存储在向量 \(M\) 和 \(D\) 中(第3-8行)。然后,对于每个token位置,我们迭代地取反 \(do\_mask\) 的值,依次获取片段长度或位置约束,直到遍历所有token,并将所有可能的片段选入集合 \(spans\)(第9-15行)。接下来,我们从 \(spans\) 中移除片段,直到掩码的token数量满足掩码率要求(第16行)。最后,我们用 “[MASK]” 替换选中的token(第17行)。给定固定的掩码率 \(r_m \in (0,1)\),将有 \(r_m \times N\) 个token被掩码,并且位置约束 \(d\) 在0和 \((1-r_m)N\) 之间,即 \(0 \leq d \leq (1-r_m)N\)。然后,\(\hat{F}_D(d)\) 可以通过对所有位置上的位置约束积分得到:
\[ \hat{F}_D(d) = \frac{1}{c} \left( \int_{0}^{d} (pos_j + d) \textrm{d}pos_j + \int_{N-d}^{N} (N - (pos_j - d)) \textrm{d}pos_j + \int_{d}^{N-d} (pos_j + d - (pos_j - d)) \textrm{d}pos_j \right) = \frac{2Nd - d^2}{c} \]
其中 \(c = (1 - r_m^2)N^2\) 用于将结果缩放至 \((0,1)\) 范围内。由于有 \(|S|\) 个片段被均匀采样,并且每对片段的位置约束遵循 \(\hat{F}_D(d)\),因此两个连续片段的位置约束遵循另一个多项式分布,记为 \(polyn(r_m, N)\):
\[ polyn(r_m, N) \sim F_D = P\left(pos_{i+1} - pos_i \leq \frac{d}{|S|-1}\right) \approx \hat{F}_D(d) \]
很明显,现有方法的 \(F_D\) 未被充分考虑,我们将在以下小节中探索不同 \(F_M\) 和 \(F_D\) 的组合。

相似文章

LOPA:通过潜在序数原型对齐提升口语评估

arXiv cs.CL

本文介绍了LOPA,一个轻量级口语评估框架,它利用潜在序数原型对齐和语义锚定层路由(基于冻结的Whisper编码器),在不进行LLM微调的情况下,实现了与十亿参数模型相当的性能。