MoganColBERT-TR:一个用于土耳其语的后交互多向量检索模型

arXiv cs.CL 论文

摘要

本文介绍了MoganColBERT-TR,一个用于土耳其语的后交互多向量检索模型,通过从先前编码器进行蒸馏训练,在土耳其语BEIR数据集上实现了具有竞争力的零样本性能。

arXiv:2608.26344v1 宣告类型:新 摘要:我们之前报告了一个从头训练的土耳其语ModernBERT编码器(MoganBERT-TR)和一个基于它的单向量嵌入模型(MoganBERT-embed)。这项工作介绍了该系列的第三个模型:MoganColBERT-TR,一个多向量检索模型,它不将查询或文档压缩为单个向量,而是通过768->128投影在词元级别表示,并使用MaxSim后交互进行打分。该模型不是从头训练的:嵌入模型的编码器作为起点,并通过一个历元的蒸馏阶段适应ColBERT目标。训练数据来自两个来源——从我们自己的预训练语料库中在字符域和句子边界处提取的标题到段落对,以及两个土耳其语基于问题的检索集——并且从交叉编码器教师(bge-reranker-v2-m3)的软分数中蒸馏,包含一个正例和七个挖掘的负例。我们表明,在硬负例挖掘中,仅基于排名的跳过是不够的,必须与组掩码和余弦上限结合使用。评估使用TurkColBERT的官方管道进行,TurkColBERT是为土耳其语后交互检索构建的基准(PLAID索引,精确MaxSim),在五个土耳其语BEIR数据集上进行;这些数据集都不在我们的训练集中,因此所有五个结果都是干净的零样本。MoganColBERT-TR拥有1.489亿参数,在五个数据集上平均总体得分为37.36(35.53 nDCG@100,31.81 nDCG@10),在五个比较模型中排名第二:它在四个数据集上优于两倍大的ColmmBERT-base-TR,总体高出+3.05,并且比基准中最大的模型高出+12.30。与领先模型(mLateOn)的差距集中在ArguAna-TR上,该数据集的查询长度远超其他。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:25

# 一种针对土耳其语的后期交互多向量检索模型
来源:https://arxiv.org/html/2608.26344
###### 摘要

我们此前报告了为土耳其语从头训练的ModernBERT编码器(MoganBERT\-TR),以及基于其构建的单向量嵌入模型(MoganBERT\-embed)。本工作介绍了该系列中的第三个模型:MoganColBERT\-TR,一个多向量检索模型。它不将查询或文档压缩成单个向量,而是通过一个→128投影在令牌级别表示它们,并使用MaxSim后期交互进行评分。该模型并非从头训练:其编码器取自嵌入模型,并通过一个单周期蒸馏阶段适配ColBERT目标。训练数据来源于两个渠道:从我们自己的预训练语料库(字符领域、在句子边界处)中抽取的标题→段落对,以及两个土耳其语基于问题的检索集。训练数据来自交叉编码器教师(bge\-reranker\-v2\-m3)对一个正样本和七个挖掘负样本的软分数的蒸馏。我们证明,在土耳其语语料条件下,仅依靠基于排序的跳过进行硬负例挖掘是不够的,必须结合组掩码和余弦值上限。评估使用了为土耳其语后期交互检索建立的基准测试TurkColBERT的官方流程(PLAID索引,精确MaxSim),在五个土耳其语BEIR数据集上进行;这些数据集均未出现在我们的训练池中,因此所有五个结果都是干净的零样本结果。拥有148\.9M参数的MoganColBERT\-TR在五个数据集上的总体得分为37\.36(35\.53 nDCG@100,31\.81 nDCG@10),在比较的五个模型中排名第二:它在四个数据集上超越了两倍大的ColmmBERT\-base\-TR,总体高出\+3\.05\+3\.05,并且比基准测试中最大的模型高出\+12\.30\+12\.30。与领先模型(mLateOn)的差距主要集中在查询长度最长的数据集ArguAna\-TR上。

## 1引言

检索的主流设计将查询和文档独立编码为各自的单个稠密向量(Karpukhin et al., 2020 (https://arxiv.org/html/2608.26344#bib.bib22);Reimers and Gurevych, 2019 (https://arxiv.org/html/2608.26344#bib.bib37))。这种设计的代价很低(文档向量可以预计算,搜索是单次内积运算),但信息瓶颈很严重:整个可变长度文档的含义被压缩成一个固定大小的点。交叉编码器消除了这一瓶颈(Nogueira and Cho, 2019 (https://arxiv.org/html/2608.26344#bib.bib33)),但需要对每一对查询‑文档进行完整的前向传播,这使得它们在语料库规模上无法使用(Lin et al., 2021 (https://arxiv.org/html/2608.26344#bib.bib26))。

ColBERT(Khattab and Zaharia, 2020 (https://arxiv.org/html/2608.26344#bib.bib23))提出了介于这两种极端之间的折中方案:查询和文档分别独立预先编码(如同双编码器),但表示保持在令牌级别,并通过将每个查询令牌与文档中最相似的令牌进行匹配(MaxSim)来计算分数。由于交互被延迟到编码后的*后期*阶段,文档端仍然可以预先计算。后续工作在质量和使用成本两方面完善了这种设计(Santhanam et al., 2022b (https://arxiv.org/html/2608.26344#bib.bib40);Santhanam et al., 2022a (https://arxiv.org/html/2608.26344#bib.bib39);Lee et al., 2023 (https://arxiv.org/html/2608.26344#bib.bib25);Dhulipala et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib11))。

这种设计之所以对土耳其语特别有意义,有其特定原因。土耳其语是黏着语;一个单词包含了英语中分散在多个单词中的所有屈折和派生信息(Oflazer and Saraçlar, 2018 (https://arxiv.org/html/2608.26344#bib.bib34))。我们自己的分词器统计数据直接显示了这一点:95%的单词*类型*被分割成多个片段,但实际词流中只有41%来自多片段词。换句话说,具有区分性的内容词被系统地分割成几个令牌,而这些片段携带的信号在平均池化过程中被混合到一个单一向量中。后期交互将这些片段保持分离,直到评分阶段。单语编码器可以超越其多语对应物,这一点已由JaColBERT系列(Clavié, 2023 (https://arxiv.org/html/2608.26344#bib.bib5);Clavié, 2024 (https://arxiv.org/html/2608.26344#bib.bib6))在日语上得到证明;本工作针对土耳其语提出了同样的问题。

本文记录了在我们之前报告的两个模型基础上构建的第三个模型:

1. 1\.MoganBERT\-TR:一个149\.4M参数的ModernBERT架构,为土耳其语从头训练,在237\.3B令牌上进行预训练,采用CLM→MLM课程学习(Warner et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib51);Yılmaz et al., 2026 (https://arxiv.org/html/2608.26344#bib.bib55)),并在TrGLUE(§2 (https://arxiv.org/html/2608.26344#S2))上比较的土耳其语ModernBERTs中表现最强。
2. 2\.MoganBERT\-embed:一个基于该编码器构建的单向量嵌入模型,经过蒸馏\+ NCE \+ GOR阶段;在MTEB\(Turkish\)上总体得分68\.30。
3. 3\.MoganColBERT\-TR(本工作):同一系列的多向量检索模型。

我们的贡献是:(i)一个针对土耳其语的ColBERT模型,基于我们自己的预训练语料库而非从外部基础模型微调而来,在TurkColBERT上以148\.9M参数排名第二,领先于两倍于其规模的模型;(ii)一个用于硬负例挖掘的三重过滤器,表明在土耳其语语料条件下仅基于排序的跳过是不够的,并用组掩码和余弦值上限进行了修正;(iii)一个可复现的数据管道,无需解码即可从预训练语料库生成ColBERT训练数据,并在句子边界处进行分割。

## 2背景:MoganBERT\-TR和单向量嵌入模型

本节仅总结前两个模型达到阅读本工作结果所需的程度;每个过程的详细原理在先前的报告中给出(Yılmaz et al., 2026 (https://arxiv.org/html/2608.26344#bib.bib55))。

#### 数据和分词器\.
预训练语料库直接从原始的月度Common Crawl快照和FineWeb的清理存档(Penedo et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib35))中生成,而非作为第三方多语种集合的子集;启发式过滤器链遵循CCNet(Wenzek et al., 2020 (https://arxiv.org/html/2608.26344#bib.bib52))和FineWeb建立的模式。语义质量过滤器从LLM标记步骤演变为土耳其语BERT(Devlin et al., 2019 (https://arxiv.org/html/2608.26344#bib.bib10))分类器,然后演变为一个fastText模型,该模型蒸馏了该分类器对480,000个样本的判断;最终过滤器与BERT的一致率为94\.4%,且速度快约∼\\sim90×\\times。分词器是一个50,048词片段的SentencePiece(Kudo and Richardson, 2018 (https://arxiv.org/html/2608.26344#bib.bib24))模型,针对土耳其语和代码使用独立的归一化管道进行训练。

#### 预训练\.
架构是ModernBERT(Warner et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib51)),Transformer(Vaswani et al., 2017 (https://arxiv.org/html/2608.26344#bib.bib46))编码器栈的现代变体(22层,隐藏尺寸768,局部注意力=128,149\.4M参数)。训练使用两阶段CLM→MLM课程学习,而非纯MLM。Gisserot-Boukhlef et al. (2025) (https://arxiv.org/html/2608.26344#bib.bib16)报告,在38个模型的受控消融研究中,这种两阶段计划在固定计算预算下优于纯MLM;在10,000步的消融中,该选择在线性探测器上几乎持平(平均\+0\.64\+0\.64点),但在土耳其语MS MARCO检索上产生了2\.7–3\.7×\\times的优势。这种差异的原因在于嵌入几何:在纯MLM运行中,单个成分占方差的28\.1%,而在课程学习运行中为11\.9%。完整的预训练在4×\\timesH100上进行,每个分支使用237\.3B令牌;在退火期间,上下文长度扩展→8192(从1024),全局RoPE(Su et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib43))θ\\theta缩放从104到1\.6×105。最终模型在8任务TrGLUE平均分为78\.41±0\.32,在比较的土耳其语ModernBERTs中最佳(TabiBERT 77\.83, ModernBERT\-TR 77\.64)。

#### 各向异性:嵌入模型的起点。
原始的预训练模型不能直接用于检索。这是用语言建模目标训练的表示中众所周知的各向异性/表示退化问题(Gao et al., 2019 (https://arxiv.org/html/2608.26344#bib.bib15);Ethayarajh, 2019 (https://arxiv.org/html/2608.26344#bib.bib12))。测量的各向异性为cosraw=0\.9841\\cos\_{\\text{raw}}=0\.9841:两个随机句子的表示几乎指向相同方向,余弦相似度将区分性信号淹没在噪声中。在这种情况下,零样本IR停滞在0\.2361\。

#### 单向量嵌入模型(MoganBERT\-embed)。
它有两个阶段。*阶段1*是使用Qwen3\-8B\-Embed(Zhang et al., 2025 (https://arxiv.org/html/2608.26344#bib.bib58))作为教师的*特征*蒸馏;学生模型从768维投影到教师的3072维空间,并在损失中添加GOR(各向异性正则化;Zhang et al., 2017 (https://arxiv.org/html/2608.26344#bib.bib57))项。这单个阶段从根本上改变了几何结构:cosraw⁡从0\.9841变为0\.0851,有效秩从117\.9变为157\.2,零样本IR从0\.2361变为0\.5927。*阶段2*是使用硬负例InfoNCE(van den Oord et al., 2018 (https://arxiv.org/html/2608.26344#bib.bib45))的对比微调;NLI、分级STS(带CoSENT损失)、分类标签、问答和并行文本信号被添加到检索对中,并辅以从头生成的40,737个情感对比三元组。最终模型通过两个阶段的权重平均(模型汤;Wortsman et al., 2022 (https://arxiv.org/html/2608.26344#bib.bib53))获得,在26任务MTEB\(Turkish\)(Muennighoff et al., 2023 (https://arxiv.org/html/2608.26344#bib.bib32))总体平均分68\.30(检索子集59\.58)上领先于比较的土耳其语模型。

#### 本工作的起点。
单向量路线的差距在于其设计本身:一旦阶段1固定了几何结构,剩余的损失并非来自各向异性,而是来自*压缩*——一个可变长度文档仍然被缩减为一个点。MoganColBERT\-TR旨在通过保持表示在令牌级别来突破这一限制。一个重要的设计决策是,编码器不是从头训练,而是从MoganBERT\-embed初始化:由两个阶段产生的各向同性、检索对齐的几何结构,作为ColBERT投影的起点,远优于原始的ModernBERT编码器。由于训练也会更新编码器,之后两个模型是独立的;我们不声称它们“共享编码器”。

## 3相关工作

### 3\.1从单向量检索到后期交互
第一波神经检索是双编码器设计,它将查询和文档独立编码为各自的单个稠密向量:DPR(Karpukhin et al., 2020 (https://arxiv.org/html/2608.26344#bib.bib22))证明这种设置在开放域问答中可以超越BM25(Robertson and Zaragoza, 2009 (https://arxiv.org/html/2608.26344#bib.bib38)),而Sentence\-BERT(Reimers and Gurevych, 2019 (https://arxiv.org/html/2608.26344#bib.bib37))将相同的架构应用于句子嵌入。后续工作沿着两个轴改进了这条路线:大规模弱监督预训练(E5, Wang et al., 2022 (https://arxiv.org/html/2608.26344#bib.bib49);BGE\-M3, Chen et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib4))和更优的负采样设计(ANCE, Xiong et al., 2021 (https://arxiv.org/html/2608.26344#bib.bib54);TAS\-B, Hofstätter et al., 2021 (https://arxiv.org/html/2608.26344#bib.bib19))。在另一极端,联合编码查询和文档的交叉编码器(Nogueira and Cho, 2019 (https://arxiv.org/html/2608.26344#bib.bib33))定义了质量上限,但无法在语料库规模上运行;Lin et al. (2021) (https://arxiv.org/html/2608.26344#bib.bib26)对这种权衡进行了全面论述。在稀疏端,SPLADE(Formal et al., 2021 (https://arxiv.org/html/2608.26344#bib.bib14))通过学习的术语扩展保留了倒排索引基础设施。

ColBERT(Khattab and Zaharia, 2020 (https://arxiv.org/html/2608.26344#bib.bib23))将*后期交互*置于这两种极端之间:表示保持在令牌级别,交互被延迟到编码后的MaxSim步骤。因此,文档端仍然可以预先计算,同时评分获得了接近交叉编码器的细节层次。

### 3\.2后期交互的演进
ColBERTv2(Santhanam et al., 2022b (https://arxiv.org/html/2608.26344#bib.bib40))通过两项更改将这条路线推向生产:从交叉编码器教师进行蒸馏,以及基于质心的残差压缩。本工作的训练设计直接遵循了该方案。后续工作主要集中在*服务*成本上:PLAID(Santhanam et al., 2022a (https://arxiv.org/html/2608.26344#bib.bib39))通过质心剪枝降低延迟,XTR(Lee et al., 2023 (https://arxiv.org/html/2608.26344#bib.bib25))通过重新思考令牌检索的作用简化了收集步骤,MUVERA(Dhulipala et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib11))将多向量搜索简化为与现有ANN基础设施兼容的固定维单向量搜索。PyLate(Chaffin and Sourty, 2025 (https://arxiv.org/html/2608.26344#bib.bib3))是一个基于sentence\-transformers(Reimers and Gurevych, 2019 (https://arxiv.org/html/2608.26344#bib.bib37))构建的开源训练和推理库;本工作的训练管道在PyLate上运行。

### 3\.3多语种和单语后期交互
在将后期交互推广到英语之外时,遵循了两种相反的策略。第一种是*多语种基础*:Jina\-ColBERT\-v2(Jha et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib21))在弱监督多语对上训练了XLM\-R(Conneau et al., 2020 (https://arxiv.org/html/2608.26344#bib.bib8))谱系的编码器,并使用交叉编码器蒸馏;ColBERT\-XM(Louis et al., 2024 (https://arxiv.org/html/2608.26344#bib.bib29))通过模块化适配器,旨在从单一高资源语言到未见语言的零样本迁移;mLateOn(Sourty et al., 2026 (https://arxiv.org/html/2608.26344#bib.bib42))在mmBERT(Marone et al., 2025 (https://arxiv.org/html/2608.26344#bib.bib31))基础上继续同一方法。第二种是*单语编码器*:JaColBERT(Clavié, 2023 (https://arxiv.org/html/2608.26344#bib.bib5))及其后继者JaColBERTv2\.5(Clavié, 2024 (https://arxiv.org/html/2608.26344#bib.bib6))表明,即使在计算预算受限的情况下,单语日语编码器也可以超越其多语种对应物。MoganColBERT\-TR属于这第二条谱系,据我们所知,是土耳其语的首个实例:编码器不是对外国模型的微调,而是一个M

相似文章

m3BERT:一种现代、多语言、套娃式双向编码器

arXiv cs.CL

本文介绍了m3BERT,一种多语言双向编码器,采用新颖的预训练策略,联合优化跨Transformer层和多个嵌入维度的表示,使得单个模型能够适应不同的资源约束。在Bing-Click工业检索数据集上,它显著优于现有最优模型。