@lateinteraction: 主题演讲录像现已上传至 YouTube,供所有要求我们在 X 平台以外托管的用户观看。https://youtube.com/watch?v=Z2…
摘要
一场主题演讲认为,后期交互检索(如 ColBERT 风格)是 AI 规模信息检索研究中最具前景的方向,并指出单向量密集检索存在根本性缺陷,呼吁信息检索社区大幅提升研究雄心。演讲引入 LIMIT 基准测试,作为密集检索泛化能力不足的佐证,并呼吁在 2030 年前实现范式转变。
主题演讲录像现已上传至 YouTube,供所有要求我们在 X 平台以外托管的用户观看。https://youtube.com/watch?v=Z2TmdcylyEc…
查看缓存全文
缓存时间: 2026/05/09 04:49
The keynote recording is now on YouTube, for everyone who asked us to host it outside X. https://youtube.com/watch?v=Z2TmdcylyEc...
---
**摘要:** 在这场主题演讲中,作者认为晚期交互检索是AI规模信息检索研究中最有前景的方向,单向量密集检索存在根本性缺陷,IR社区必须大幅提升雄心,才能抓住这一历史性机遇。
---
# 晚期交互在2030年
## 核心论点概览
这场演讲围绕一系列相互关联的论点展开,核心问题是:信息检索(IR)社区是否正在抓住它所面对的历史性机遇?
---
## 信息检索是当前AI领域投资回报率最高的研究方向
**第一个主张:信息检索目前可能是AI领域中投资回报率最高的研究方向。**
要理解这一点,需要审视大型语言模型的进展,以及所谓"AGI即将到来"的叙事。在无限算力条件下,系统所能达到的**上限**极高。就在一年前,社区还在争论语言模型到底能不能用来做相关性标注。而如今,我们基本上已经知道如何判断任意一篇文档是否相关——只要资金充裕,语料库想多大就多大。换言之,**交叉编码器(cross encoder)已经无限接近被"解决"了**。
与此同时,**下限**与上限之间的差距却越来越大。这不是因为下限没有进步,而是因为我们能在次线性时间内完成、可以规模化的那些事情,从根本上还停留在几年前的范式。BERT革命之后涌现了很多新方法,社区也在持续改进,但从根本上说,仍是同一套框架。
这种上限极高、下限相对滞后的局面,正是绝佳机会所在。这种情况在人们刚开始对语言模型或推理模型感兴趣时并不存在——GPT-3无法击败最好的检索模型,GPT-4也做不到——但现在,情况真的不同了。
---
## IR社区需要更有雄心
然而,这一机遇只有在IR社区**远比现在更有雄心**的前提下才能实现。问题不在于基准测试的数量,而在于**难度**,以及与当前现状的差距。
我们集体接受了"检索-重排序"这个范式——这是2000年代初甚至更早的东西——以及单向量检索作为核心范式之一。正因为我们预先决定了要做检索-重排序,我们对很多问题制造了盲点:那些连基本关键词匹配或基本密集检索都达不到10%召回率@1000的场景。如果所有方法在top-1000的召回率都很低,那任何重排序都无济于事,我们就面临一个根本无法解决的检索问题。这样的问题到处都是,只是因为我们预设了以重排序为导向的方法,所以根本没有去寻找它们。
---
## 单向量密集检索的根本局限
**单向量密集嵌入已经不奏效,也将继续无法奏效,其局限性只会越来越暴露出来。**
### LIMIT:一个警钟
**LIMIT** 基准测试应该成为整个社区的警钟。它的设计极其简单:一堆人名,每个人喜欢一系列不同的东西,查询被构造成每个查询恰好有两个相关结果。令人震惊的是——即便是对于一个已经批评单向量检索六七年的人来说——在**仅有46篇文档**的小型任务上(完全没有规模问题),那些在海量网络数据上训练的大型模型(Mistral、Qwen等,训练数据规模高出数个数量级),居然无法在46篇文档的top-10中检索出正确结果。
LIMIT的重要性恰恰在于它**如此简单**,却让我们沿用的范式暴露出如此严重的泛化能力缺陷。这让我们在面对难度高出几个数量级的真实IR任务时,处境十分被动。
### 来自实验数据的佐证
Niels Rogge发布的数据显示,规模小得多的晚期交互模型——重要的是它们不是密集单向量检索器——在相同LLM的条件下,**大幅优于**规模大得多的单向量表示模型。基准测试排行榜顶部的方法几乎全部是非单向量的。
---
## 三种范式的对比
| 范式 | 优势 | 劣势 |
|------|------|------|
| **交叉编码器** | 质量极高,联合编码查询与文档 | 不可扩展;N篇文档就要打N次分 |
| **单向量密集检索** | 可扩展性极强,支持对数时间搜索 | 对超出特定领域主题查询的任务,质量问题持续近十年 |
| **晚期交互** | 兼顾质量与可扩展性 | 存储开销较高(但可大幅压缩) |
### 2030年的格局重估
2019至2020年的那套叙事,在当前的发展方向上已经站不住脚:
- 如果你有一个已经是智能推理模型的LLM,且拥有极长的上下文窗口,**交叉编码器的角色变得存疑**。快速长上下文注意力加推理模型,本质上已经是交叉注意力,已经是你的交叉编码器。
- 对于真正困难的任务,**召回率至关重要**,而密集向量作为第一阶段检索的角色同样值得质疑。
---
## 晚期交互的核心思想
晚期交互的思路是:**同时保留两种范式的优点**。
- 保留单向量方法的优点——独立计算文档表示,预先存储,无需对每个查询重复该工作。
- 但**不压缩表示**,而是保留细粒度的泛化表示。
IR历史始终告诉我们,把文档分解成片段是有用的。如果一篇文档包含10个或100个概念,在几何嵌入空间中找到一个点,使所有相关查询都靠近、所有无关查询都远离,是极其困难的。细粒度表示从根本上规避了这一问题。
然而,仅有细粒度表示还不够——还需要**类似注意力的评分机制,同时支持次线性搜索**。语料库规模翻倍时,搜索代价不能翻倍。
### MaxSim:向量层面的软匹配
大家熟悉的 **MaxSim(最大相似度求和)** 设置,本质上是**向量层面的软匹配**——就像BM25或TF-IDF,只是在向量空间中操作,然后加总,逻辑与TF-IDF完全一致。
好消息是,这些向量非常局部化,因此**极易压缩**。每个向量只捕获一个词,而词的义项数量是有限的。在实践中,每个向量可以轻松压缩到20个字节甚至更小——相当于在32维空间中存储5维向量,极其紧凑,远比文档的单一全局表示更容易压缩。
---
## 晚期交互:什么是真正必要且充分的?
ColBERT只是一种具体实例化,并不特别神圣。它作为设计空间中某个特定点存在的时间已经太长了。真正值得追问的是:**是什么导致了某些方法泛化能力更强、某些更弱的反复规律?晚期交互的概念中哪些部分是真正根本性的?**
仅仅是"多向量IR"吗?这个术语本身并不够准确——它遗漏了这个范式中最有趣的部分。已知的反例是:如果用 sum-sum(对所有向量对的相似度全部求和)替代 max-sum,效果就会大幅下降,说明**MaxSim操作本身的结构设计**,而非仅仅是多向量表示,才是这个范式泛化能力的关键来源。
---
## 结语
IR社区正站在一个历史性节点上:上限从未如此之高,而下限与上限的差距也从未如此之大。LIMIT这样的基准测试揭示的不是一个边缘案例,而是整个范式的系统性缺陷。晚期交互,作为一种通用范式而非ColBERT这一特定实现,可能是填补这一差距最有希望的方向——但前提是整个社区必须愿意放弃对旧范式的路径依赖,真正地提高雄心。
---
来源:https://www.youtube.com/watch?v=Z2TmdcylyEc
相似文章
天啊,我几乎忘了在做ColBERT相关工作时得到令人垂涎的结果是多么即时 - @antoine_chaffi…
作者表达了对ColBERT模型在机器学习中提供即时高质量结果的兴奋,并暗示即将发布开源模型,展示了晚期交互技术在没有存储开销下的效率。
@lateinteraction:对于某些晚期交互来说,永远都不会太晚——太酷了 @sirupsen @turbopuffer!
Turbopuffer 宣布对晚期交互(late interaction)的 beta 支持,使 ColBERT 等模型能够将文本表示为 token 级向量,将快速的单向量 ANN 初步搜索与精确的晚期交互重排序相结合,以提高召回率。
@mixedbreadai: https://x.com/mixedbreadai/status/2071678747439505816
Mixedbread AI 引入了用于后期交互检索的非对称量化技术,通过将文档向量存储为二进制符号同时保持查询向量高精度,实现了32倍的存储缩减且质量损失极小,使得后期交互在十亿级生产系统中变得实用。
@raphaelsrty:今天我们开源 LateOn 与 DenseOn,两款 149 M 参数的开放检索模型
Raphael 开源两款检索模型:LateOn(ColBERT 多向量)与 DenseOn(单向量),均 149 M 参数,在 BEIR 上超越体量 4 倍的大模型。
@Julian_a42f9a:后期交互检索模型的表示已超越检索本身,可直接用于RAG
新论文表明,后期交互检索模型的表示可替代原始文档文本,在RAG任务中拓展其应用边界。