将表示与重构分离实现可扩展文本编码器

arXiv cs.CL 论文

摘要

CrossBERT将表示学习与令牌重构解耦,实现更高的掩码比例和更好的样本效率,在MTEB和GLUE基准测试上超越BERT。

arXiv:2607.04011v1 公告类型:新 摘要:虽然解码器已经快速扩展,但编码器自BERT以来基本保持不变。我们通过冻结骨干网络的探针评估重新审视这一差异。在这种视角下,BERT编码器的表示变得越来越被冻结探针$\textit{无法利用}$,尽管困惑度有所改善。这种错位源于BERT的平面设计,它将表示学习与令牌重构损失耦合在一起。我们提出$\textbf{CrossBERT}$,一种将高质量编码表示的学习与令牌重构的刚性基础分离的两部分架构。这种设计进一步通过$\textit{互补掩码策略}$实现了高掩码比例($\ge 50\%$)和所有令牌上的梯度收集,分别将吞吐量提高$1.5$到$2\times$,样本效率提高$2\times$。总体而言,CrossBERT在MTEB(eng, v2)和冻结GLUE基准测试上展示了单调扩展和优越性能。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:38

# 分离表示与重建实现可扩展文本编码器  
来源:https://arxiv.org/html/2607.04011  

###### 摘要  
虽然解码器快速扩展,但编码器自 BERT 以来基本保持不变。我们通过基于探针的冻结骨干网络评估来重新审视这一差异。在这种视角下,BERT 编码器的表示在冻结探针下变得愈发不可利用,尽管其困惑度有所提升。这种不匹配源于 BERT 的扁平设计,该设计将表示学习与标记重建损失耦合在一起。我们提出 CrossBERT,一种两部件架构,将高质量编码表示的学习与标记重建的刚性约束分离开来。该设计进一步支持高掩码比例(≥50%),并通过互补掩码策略对所有标记进行梯度收集,分别将吞吐量提升 1.5 至 2 倍,样本效率提升 2 倍。总体而言,CrossBERT 在 MTEB(英语,v2)和冻结 GLUE 基准测试上表现出单调扩展和卓越性能。  

BERT, 编码器, SSL, 文本, ICML  

参考图注 参考图注  

图 1:上:编码器在 GLUE 上的冻结评估,线性探针和 KNN 探针拟合在冻结骨干网络的平均表示上。下:MTEB(英语,v2)评分。“(冻结)”表示仅在编码器的冻结特征之上微调池化器,即冻结骨干网络。“(未冻结)”表示整个网络(包括骨干网络)进行端到端微调。两者均仅在 MS-MARCO 上使用硬负例微调一个周期。  

## 1 引言  
编码器对多种现代应用至关重要,从大规模数据整理和检索增强生成到推荐系统。然而,自 BERT 以来,编码器架构基本未受挑战,大多数改进源于扩展训练数据集。研究社区专注于利用预训练模型仅作为初始化的复杂后训练流程(Wang 等人,2022)。这种对下游微调的严重依赖并未暴露预训练骨干网络的缺陷,阻碍了其发展。Dervishi 等人(2025)最近展示了忽视预训练的代价:前沿预训练骨干网络如 ModernBERT(Warner 等人,2025)和 NeoBERT(Breton 等人,2025)相对于其规模被过度训练。  

参考图注  

图 2:左:互补掩码策略(CMS)通过替换标记将一批标记增强为两个互补掩码视图。掩码标记为红色;两个视图的未掩码标记分别为绿色和蓝色。数字表示位置索引。右:CrossBERT 从一个视图(蓝色)预测另一个视图(绿色),反之亦然。两个视图并行处理,使用注意力掩码隔离一个视图与另一个视图,防止信息泄露。编码器将未掩码标记及其位置索引作为输入。轻量级预测器接收占位符及其位置索引;它从未看到掩码标记的内容。预测器通过交叉注意力关注编码器的输出表示,并通过交叉熵损失训练以重建互补视图。实色框表示标记(红色、蓝色/绿色真实值);带阴影框表示表示(蓝色来自编码器,粉色来自预测器)。  

与此同时,视觉编码器社区通过扩展策略(Bolya 等人,2025;Sun 等人,2023;Oquab 等人,2023;Siméoni 等人,2025)和新颖训练方法(Fu 等人,2024;Chen 等人,2020;Caron 等人,2021;Darcet 等人,2025;Assran 等人,2023;Bardes 等人,2021;Garrido 等人,2024;He 等人,2022)持续改进预训练骨干网络。由于这些编码器通常以冻结方式使用,即无需修改,评估标准自然优先考虑冻结基准测试,从而鼓励预训练创新。有效的表示学习由冻结嵌入的可解释性和通用性定义。受视觉社区近期架构见解的启发,我们重新审视文本编码器的设计和评估。具体而言,我们进行全面的扩展分析,评估冻结预训练骨干网络的表示,同时结合标准微调协议。这一视角转变揭示了一个反直觉现象:随着现代 BERT 模型扩展,其特征在冻结探针下变得越来越不可利用。为解决这一瓶颈,我们引入 CrossBERT。受 He 等人(2022)和 Fu 等人(2024)的启发,CrossBERT 通过在最终骨干网络层后附加轻量级交叉注意力预测器,将表示学习与标记重建解耦。这一架构转变确保骨干网络完全专注于特征提取,而标记重建被隔离在预测器中。我们证明这一新颖设计在模型扩展时保持了表示质量。此外,即使仅使用 MS-MARCO 在数据受限的对比设置中进行评估,CrossBERT 也减轻了饱和效应,并展现出比标准基线显著更优的扩展趋势。本文中,我们的基线 BERT 为现代实现(见第 5.1 节)。BERT 和 CrossBERT 仅在架构结构上有所不同:扁平 vs. 二分。在第 2 节中,我们解释了对 BERT 架构失效模式的猜想以及 CrossBERT 如何解决。在第 3 节中,我们详细描述 CrossBERT 的架构并介绍其相对于常规 BERT 模型的优势。在第 4 节中,我们总结用于仅衡量预训练性能的新型冻结评估方法。最后,我们在第 5 节中展示实验结果并进行讨论,并在第 8 节中总结未来工作。  

贡献  
1. C1. CrossBERT 架构:我们引入一种二分编码器,确保在冻结评估上实现一致的性能扩展。据我们所知,这是首个用于文本的掩码自编码器。  
2. C2. 通过高掩码比例实现高效训练:我们展示 CrossBERT 在掩码比例 >50% 时的鲁棒性,将训练吞吐量提升约 1.5–2 倍。此外,这种容忍性使得互补掩码策略(CMS)成为可能,该策略并行处理逆掩码。通过收集序列中每个标记的梯度,有效将样本效率提高一倍。  
3. C3. 冻结评估下的扩展规律:我们进行扩展分析(2×10^18 到 1×10^21 FLOPs)以量化内在表示质量。这暴露了标准 BERT 的性能差距,并验证了 CrossBERT 优越的可提取性,该优势延伸到 MTEB 任务。  

## 2 CrossBERT:直觉  

#### 问题:  
BERT 表示随计算量扩展而恶化,如图 1 所示。  

#### 解释:  
我们推测这种退化源于扁平 BERT 架构上应用的掩码语言建模(MLM)目标(Devlin 等人,2019)。MLM 训练编码器重建被破坏的输入序列。给定令牌序列 X={x_1,…,x_N},选择子集 M 进行掩码。这些位置的令牌被特殊令牌替换,产生破坏序列 X̃。模型处理 X̃ 以生成上下文表示,目标是最小化掩码位置原始令牌 x_m 的负对数似然:  
L_MLM = -∑_{m∈M} log P(x_m | X̃)  (1)  
其中 P(x_m | X̃) 表示预测头分配给真实令牌 x_m 的概率。  
因此,该目标仅衡量模型的令牌重建能力,而非其表示的实际质量。由于 BERT 架构的“扁平”设计没有明确分离表示创建与令牌重建,表示仍然过度“扎根”于预测缺失令牌所需的局部信号,而非成为通用的高层抽象。表 1 中展示了这种现象的一些证据,其中对不同深度的 BERT 编码器进行探针测试。值得注意的是,从较浅层而非最终输出层检索表示会带来略优的性能,显示出最后几层的过度专门化。  

#### 解决方案:  
受视觉中掩码自编码器(MAE)方法(He 等人,2022;Fu 等人,2024)的启发,我们提出 CrossBERT:一种二分架构,将表示创建(编码器)的重任与令牌重建(预测器)的具体任务分离,如图 2 所示。  

## 3 CrossBERT:架构与优势  

### 3.1 架构  
架构示意图见图 2 右面板。输入序列被划分为可见集(由编码器处理)和掩码集(由预测器处理)。为保持序列顺序,我们通过 RoPE 编码每个令牌的位置,确保编码器和预测器知晓缺失的位置。预测器是几个仅交叉关注编码器表示的 Transformer 模块。通过移除掩码令牌之间的自注意力,我们迫使预测器严格作为“读出”接口,必须仅通过查询编码器嵌入来满足其目标。此外,我们实现了现代架构优化(Warner 等人,2025;Breton 等人,2025),如 RMSNorm。为设置编码器和预测器的大小,我们参照 MAE(He 等人,2022)。预测器共享编码器的隐藏维度,但明显更浅(约为编码器深度的四分之一)。关于预测器形状和大小的消融实验见附录 A。我们从该消融实验中获得两个见解。首先,预测器的具体纵横比(宽度 vs. 深度)并不重要。其次,虽然增加预测器容量可以带来一些性能提升(收益递减),但代价是训练速度变慢。由于我们的目标是获得丰富的冻结特征,我们决定将大部分计算分配给编码器。  

表 1:BERT 上逐层冻结 GLUE 评分分析。评分通过在第 4.1 节所述的冻结特征上拟合线性探针获得。  
| 模型 | last | last-1 | last-2 | last-3 | 2020th | Avg. Improv. |
|------|------|--------|--------|--------|--------|--------------|
| BERT 239M | 67.4 | 68.5 | 69.5 | 70.2 | 68.7 | +1.8 |
| BERT 1.21B | 64.6 | 65.8 | 65.0 | 65.9 | 66.6 | +1.2 |

### 3.2 新兴优势  
这一设计选择带来了几个优势:预测器的迁移学习;对较高掩码比例的鲁棒性;使用互补掩码策略(CMS)的能力;更好的数据效率和更低的训练成本。  

#### 可迁移性:  
预测器在预训练期间仅从编码器表示中学习提取信息。因此,预测器充当了一种学习到的池化机制。它可以有效地作为下游微调的热启动模块,充当冻结编码器特征与目标任务之间的高效桥梁。  

#### 对较高掩码比例的鲁棒性:  
BERT 架构通常在掩码比例超过 20–40% 时性能下降(Wettig 等人,2023)(见附录 C)。我们通过分析 CrossBERT 在多个掩码比例下的冻结表示质量来挑战这一限制。如表 2 所示,CrossBERT 表现出显著的稳定性:将掩码从 20% 增加到 50% 仅导致 GLUE 性能可忽略不计的下降(-0.7%)。这种韧性证实了我们的二分架构成功地将表示学习与重建任务的难度隔离开来。增加到更高的掩码比例直接转化为降低的训练成本,这为互补掩码策略(CMS)打开了大门。  

表 2:不同掩码比例下 CrossBERT 的平均冻结 GLUE 评分(保持相同数据预算)。  
| 掩码比例 (%) | 20 | 40 | 50 | 65 |
|--------------|----|----|----|----|
| CrossBERT    | 73.8 | 73.7 | 73.1 | 72.4 |

#### CMS:互补掩码策略  
如图 2 左面板所示。每个批次都补充其逆掩码,即为原始令牌序列创建两个互补视图。这使得模型能够预测并从序列中的每个令牌学习。模型通过在每个视图上应用独特的注意力掩码,确保来自原始序列的信息不会“泄漏”到同一批次中的互补视图中。因此,两个视图可以同时处理。对于 BERT,这种方法与 20%–40% 的掩码比例要求配合不佳,因为逆视图会落在 60%–80% 的比例上。由于 CrossBERT 在超过 50% 的掩码比例下仍然有效,它可以高效地从原始序列和互补序列中学习。  

#### 样本效率:  
MLM 以其样本效率低下而闻名;模型每轮仅从一部分令牌中学习,因为梯度仅针对掩码令牌计算。然而,通过使用 CMS,CrossBERT 处理可见令牌及其逆令牌,有效地一次性看到序列中的所有令牌并从预测器中预测所有令牌。实验上,我们的结果(附录 B)确认 CMS 相对于标准掩码并未损害基线性能。相反,CMS 有效地将样本效率提高了一倍,仅需一半的训练数据即可达到相同的性能。  

#### 计算效率:  
即使 BERT 采用 CMS,计算成本也会高得令人望而却步:需要对整个序列进行两次前向-反向传播。另一方面,CrossBERT 的编码器丢弃了掩码令牌。因此,使用 CMS 进行训练的成本仅为编码器和预测器对整个序列进行一次前向-反向传播。

相似文章

m3BERT:一种现代、多语言、套娃式双向编码器

arXiv cs.CL

本文介绍了m3BERT,一种多语言双向编码器,采用新颖的预训练策略,联合优化跨Transformer层和多个嵌入维度的表示,使得单个模型能够适应不同的资源约束。在Bing-Click工业检索数据集上,它显著优于现有最优模型。

TRL-Bench: 跨范式表格编码器表示级别评估的标准化

Hugging Face Daily Papers

TRL-Bench 是一个统一的框架和库,用于标准化对20个编码器、16个任务和87个数据集的表格表示学习模型的评估。它提供了一个通用接口来比较异构表格模型,并揭示了没有一个编码器在所有任务中都是最佳的。