@_reachsumit: Latent Terms: 密集检索器包含可轻松提取的BM25就绪齐普夫词汇表 @bclavie 等人提取中…

X AI KOLs Following 论文

摘要

该论文提出 Latent Terms 方法,使用稀疏自编码器从冻结的密集检索器中提取BM25就绪的稀疏特征,无需检索特定训练即可实现有竞争力的性能。

Latent Terms: 密集检索器包含可轻松提取的BM25就绪齐普夫词汇表 @bclavie 等人使用重建训练的稀疏自编码器从冻结的密集检索器中提取可索引的、BM25就绪的稀疏特征。 📝 https://t.co/WRIaCu2xIm
查看原文
查看缓存全文

缓存时间: 2026/05/29 23:58

Latent Terms: Dense Retrievers Contain Trivially Extractable BM25-ready Zipfian Vocabularies

@bclavie 等人使用基于重建训练的稀疏自编码器,从冻结的密集检索器中提取可索引的、适用于BM25的稀疏特征。

📝 https://t.co/WRIaCu2xIm


Latent Terms:密集检索器包含可轻易提取的、可用于BM25的齐普夫词汇表

来源:https://arxiv.org/html/2605.29384 Benjamin Clavié1,2, Sean Lee1, Aamir Shakir1, Makoto P. Kato2,3
1Mixedbread AI, 2国立信息学研究所(NII), 3筑波大学
通讯作者:[email protected] (https://arxiv.org/html/2605.29384v1/mailto:[email protected])

摘要

我们提出 Latent Terms,该方法揭示了经过密集检索训练的模型(无论是单向量还是多向量)所学习的表示可以被轻易地分解为可直接用于检索的稀疏特征。当在冻结的检索器上训练时,无需任何检索特定的调整,稀疏自编码器就能提取出一个具有近似齐普夫集合统计特性的潜在词汇表,直接适用于通过BM25进行的经典稀疏检索评分。这种方法无需任何学习扩展目标或稀疏检索监督即可实现稀疏检索,并且可以轻松应用于任何密集检索器。Latent Terms 能够匹配或超越其基础模型自身的单向量评分方法以及类似的SPLADE变体的性能。此外,在专门设计用于凸显单向量检索缺陷的LIMIT任务上,它显著优于其基础模型。总体而言,我们的结果强调了神经检索器包含比其默认评分函数所暴露的更具表现力和可索引的结构,但其他方法仍然可以利用这些结构。

Latent Terms:密集检索器包含可轻易提取的、可用于BM25的齐普夫词汇表

Benjamin Clavié1,2, Sean Lee1, Aamir Shakir1, Makoto P. Kato2,3
1Mixedbread AI, 2国立信息学研究所(NII), 3筑波大学
通讯作者:[email protected] (https://arxiv.org/html/2605.29384v1/mailto:[email protected])

1 引言

神经信息检索与表示学习紧密相关。检索模型通常基于预训练语言模型骨干构建,训练生成可通过特定评分接口搜索的表示 (Mitra and Craswell 2018 (https://arxiv.org/html/2605.29384#bib.bib172))。实践中,神经检索器通常根据推理时暴露的表示及其评分所使用的算子进行分类。密集单向量检索器将查询和文档各编码为一个向量,并通过点积或余弦相似度进行评分 (Yates et al. 2021 (https://arxiv.org/html/2605.29384#bib.bib109))。延迟交互或密集多向量检索器则暴露出多个词级向量,并通过MaxSim等操作进行评分 (Khattab and Zaharia 2020 (https://arxiv.org/html/2605.29384#bib.bib92))。学习型稀疏检索器(如SPLADE)暴露稀疏的词汇权重,可以高效索引和搜索 (Formal et al. 2021b (https://arxiv.org/html/2605.29384#bib.bib63))。

与此同时,稀疏自编码器(SAE)——一种将模型激活映射到高维稀疏编码,然后从该编码重建原始激活的模型——已成为分析神经网络内部表示广泛使用的工具 (Cunningham et al. 2023 (https://arxiv.org/html/2605.29384#bib.bib200); Gao et al. 2024 (https://arxiv.org/html/2605.29384#bib.bib182))。

在这项工作中,我们探究检索器暴露的接口是否捕捉了模型学到的所有检索相关结构。近期研究表明,单向量检索器有时可以适配为强大的多向量检索器 (Clavié 2024 (https://arxiv.org/html/2605.29384#bib.bib151); Chaffin 2025 (https://arxiv.org/html/2605.29384#bib.bib173)),这表明训练好的检索器可能编码了超出其默认评分接口暴露范围的有用检索结构。我们研究一个互补的问题:密集检索器是否也包含稀疏、可索引的结构,即使它们并非为生成稀疏表示而训练?

具体来说,我们假设SAE可以通过将模型的表示转换为“准词汇”潜在词汇表,从密集检索器中恢复这种结构。为验证这一假设,我们引入 Latent Terms。给定一个冻结的检索器,Latent Terms 对查询和文档进行编码,通过SAE投影它们最终层的词元表示,并直接对得到的稀疏激活应用BM25 (Robertson et al. 1995 (https://arxiv.org/html/2605.29384#bib.bib19)),将激活的特征索引视为词汇项,将变换后的激活幅度视为词项权重。

值得注意的是,Latent Terms 并未使用检索监督训练稀疏检索器,也未使用任何通常所需的稀疏训练方法,如学习扩展目标 (Formal et al. 2021b (https://arxiv.org/html/2605.29384#bib.bib63))、难负样本 (Xiong et al. 2021 (https://arxiv.org/html/2605.29384#bib.bib202)) 或稀疏正则化(FLOPs正则化最为常见,替代方案仍是活跃研究领域 (Porco et al. 2025 (https://arxiv.org/html/2605.29384#bib.bib174)))。相反,SAE仅使用从FineWeb-Edu (Penedo et al. 2024 (https://arxiv.org/html/2605.29384#bib.bib180)) 提取的网页文本,以标准SAE重建目标进行训练。所有稀疏性均来自SAE本身,而排序则由经典BM25评分器对所得特征进行。

我们将 Latent Terms 应用于多个原有检索性能各异的密集检索器。尽管方法简单,Latent Terms 始终从所有评估的冻结骨干中提取出强大的稀疏检索性能:它匹配了可比的SPLADE变体(注:可比模型定义为同一时期开发的竞争模型),并在所有测试的单向量骨干上优于基础模型的单向量余弦相似度方法。这种提升在专门设计用于暴露单向量模型局限性的基准测试上尤为显著,进一步表明 Latent Terms 能够利用模型中存在但通过其单向量评分接口无法访问的相关结构。

接着,我们展示了从检索模型学习的SAE特征形成了一个潜在词汇表,其集合统计特性类似于自然语言词项,为BM25提供了有意义的文档频率统计。定性分析支持了SAE提取有意义词汇表的观点,该词汇表包含词汇以及窄义和广义语义单元的混合,将稀疏可索引性与从神经检索器内部表示中诱导出的词汇表结合起来。

总体而言,我们的结果提出了对神经检索模型的不同看法。模型的默认评分函数未必是访问其检索知识的唯一有用途径。密集检索器可以包含其推理接口未暴露的稀疏、表现力强且可索引的结构,而这种结构可以通过重建训练的SAE和经典稀疏IR方法(如BM25)恢复。

贡献总结而言,我们的贡献如下:我们 (i) 引入了 Latent Terms,一种使用重建训练的SAE将冻结检索器激活转换为可使用BM25搜索的稀疏表示的简单方法;(ii) 展示了这些潜在词汇表在无需稀疏检索监督的情况下支持强大的稀疏检索;以及 (iii) 通过展示生成的词汇表具有类似词项的集合统计特性以及有意义的语义和词汇单元混合,提出了一种解释该方法为何有效的原因分析。

2 背景

2.1 稀疏自编码器

稀疏自编码器(SAE)是浅层神经网络,旨在使用高维稀疏编码 z ∈ R^m_≥0(通常 m ≫ d)来表示密集激活 h ∈ R^d。它们基于编码器-解码器架构构建,由编码器 f_enc 和解码器 f_dec 组成:

z = f_enc(h), ĥ = f_dec(z), (1)

联合训练时包含一个目标,由鼓励信息保留的重建项和确保每个输入仅激活少量潜在特征的稀疏惩罚项组成:

L_SAE(h) = ‖h - ĥ‖²₂ + λ‖z‖₁. (2)

SAE已成为神经网络,特别是语言模型可解释性中的常见工具。在后一种情况下,SAE训练的激活是个别词元级的激活。这种方法用于将密集神经激活分解为比原始表示的单个坐标更局部化和可解释的特征 (Cunningham et al. 2023 (https://arxiv.org/html/2605.29384#bib.bib200); Lieberum et al. 2024 (https://arxiv.org/html/2605.29384#bib.bib175); Templeton et al. 2025 (https://arxiv.org/html/2605.29384#bib.bib176)),从而促进了解释本来“黑盒化”的神经激活过程。实际上,SAE的目标不是通过可能具有多义性的单个维度来解释激活,而是学习一个基础,其中不同的潜在维度可以映射到特定的模式或概念 (Bricken et al. 2023 (https://arxiv.org/html/2605.29384#bib.bib177))。

2.2 Okapi BM25

Okapi Best Match 25,通常简称为BM25 (Robertson et al. 1995 (https://arxiv.org/html/2605.29384#bib.bib19)),是经典信息检索中一种普遍存在的方法,面对现代神经方法仍然惊人地具有竞争力,尤其是在适当按数据集调整参数时 (Kamphuis et al. 2020 (https://arxiv.org/html/2605.29384#bib.bib203))。给定查询 Q 和文档 D,BM25通过求和文档中出现的查询词项的贡献来对 D 评分:

BM25(Q, D) = Σ_{t∈Q} IDF(t) * (f(t,D)(k₁+1)) / (f(t,D) + k₁K_D), (3) K_D = 1 - b + b(|D|/avgdl).

这里,f(t,D) 是词项 t 在文档 D 中的频率,|D|D 的长度,avgdl 是集合中的平均文档长度,k₁ 控制词项频率饱和,b 控制文档长度归一化。逆文档频率项通常定义为:

IDF(t) = log( (N - n(t) + 0.5) / (n(t) + 0.5) ), (4)

其中 N 是文档总数,n(t) 是包含词项 t 的文档数。

传统上,BM25直接用于文本输入,经过不同程度的预处理,作为基于词项定义的词袋方法。其评分结合了逆文档频率、词项频率饱和度和文档长度归一化。然而,其底层假设本质上并非词汇的:BM25原则上可以应用于任何具有有意义的集合频率、幅度和长度的稀疏特征集。

2.3 学习型稀疏检索

学习型稀疏检索涵盖了一系列神经方法,它们保留了经典词汇检索的效率,同时利用语言模型改进其表示。广义上,通用的方法是保留稀疏的、基于词汇索引的表示,但这些表示由模型学习或增强,而不是直接从输入文本的表面形式导出。

多年来,这采取了多种形式,早期的实例分别处理查询和文档。最初,工作侧重于文档端:DeepCT (Dai and Callan 2019 (https://arxiv.org/html/2605.29384#bib.bib196)) 和 DeepImpact (Mallia et al. 2021 (https://arxiv.org/html/2605.29384#bib.bib178)) 开发了上下文方法来学习稀疏文档表示,而 Doc2Query 方法 (Gospodinov et al. 2023 (https://arxiv.org/html/2605.29384#bib.bib181); Nogueira et al. 2019 (https://arxiv.org/html/2605.29384#bib.bib197)) 则侧重于词汇扩展以缓解文档/查询词汇不匹配问题。uniCOIL (Gao et al. 2021 (https://arxiv.org/html/2605.29384#bib.bib190)) 进一步扩展了这些方法,试图调和它们,学习词汇词项上的标量权重,并可选择进行词汇扩展。

在这些早期工作之后,SPLADE (Formal et al. 2021b (https://arxiv.org/html/2605.29384#bib.bib63)) 提出在一个端到端模型中联合处理权重分配和扩展,利用预训练模型(如BERT (Devlin et al. 2019 (https://arxiv.org/html/2605.29384#bib.bib16)))的语言建模能力。给定输入序列 x,SPLADE 重用其基础编码器的语言建模头,将每个上下文词元表示 h_i 投影到编码器词汇表 V 上,然后将这些投影聚合成单个稀疏向量 w(x) ∈ R^|V|_≥0

w_j(x) = max_{i in 1...|x|} log(1 + ReLU(MLM(h_i)_j)). (5)

通过 log-ReLU 变换确保非负词汇权重,并通过最终的池化操作允许每个词汇项由最相关的输入位置激活。因此,得到的稀疏向量可以包含观察到的词项和语言模型预测的扩展词项。评分定义为稀疏向量匹配,通常用内积表示:

s(q,d) = ⟨w(q), w(d)⟩ = Σ_{j∈V} w_j(q) w_j(d). (6)

由于大多数坐标为零,这些表示可以使用高效索引方法(如倒排索引)进行索引和搜索,同时仍然受益于上下文神经词项权重分配和扩展。

然而,要使用SPLADE风格的模型实现有竞争力的检索,需要的远不止简单地应用掩码语言建模头。除了常见的检索训练复杂性(如挖掘难负样本或知识蒸馏技术 (Lassance et al. 2024 (https://arxiv.org/html/2605.29384#bib.bib102))),SPLADE的性能可能对其他模型家族不敏感的因素敏感,例如分词方法 (Hu 2026 (https://arxiv.org/html/2605.29384#bib.bib184)),并且需要在训练期间进行显式的稀疏正则化 (Formal et al. 2021b (https://arxiv.org/html/2605.29384#bib.bib63), 2024 (https://arxiv.org/html/2605.29384#bib.bib191))。

2.4 其他基于SAE的检索工作

CL-SR (Park et al. 2025 (https://arxiv.org/html/2605.29384#bib.bib179)) 提出使用SAE重建密集检索器的最终单向量表示的任务。这样,他们证明了提取的特征不仅提供了一定程度的可解释性,并且表明得到的潜在特征可以以类似SPLADE的方式评分,使用内积进行检索,他们称之为概念级稀疏检索的一种形式。然而,尽管这是一个有前景的方向,其检索性能相比原始单向量检索器显著下降。

相似文章

无需训练的词汇-密集融合用于会话记忆检索

arXiv cs.LG

本文提出了一种无需训练、仅使用CPU的检索方法,该方法将BM25词汇分数与后期交互密集分数相融合,用于会话记忆检索,在六个编码器上相比仅使用后期交互,在LoCoMo Hit@1上提升了高达+17.2个点。该研究提供了关于池化操作符、重排序器效果和基准鲁棒性的受控消融实验,将这种提升视为密集信号与词汇信号之间的分工。