量化并扩展晚期交互检索模型的理论容量
摘要
本文量化并扩展了晚期交互检索模型的理论容量,证明MaxSim可以复制非负向量之间的内积,并提出适用于任意实值向量的Signed MaxSim,揭示了内积模型与晚期交互模型之间的表示差距。
查看缓存全文
缓存时间: 2026/07/08 06:48
论文页面 - 量化并扩展延迟交互检索模型的理论容量
来源:https://huggingface.co/papers/2607.05803
本文有助于解释为什么MaxSim的性能如此出色。研究表明,MaxSim可以精确复现两个潜在无限维稀疏向量之间的内积,其中延迟交互表示的规模仅受原始向量中非零元素数量的影响。这解释了为什么延迟交互模型具有如此出色的泛化能力——它们可以编码长尾特征,无需压缩任何信息。同时,这也意味着延迟交互模型能够精确复现任何使用严格非负向量的检索模型,例如SPLADE和BM25。
我们发现MaxSim无法复现任意实值向量之间的内积。为了解决这个问题,我们提出了有符号MaxSim(Signed MaxSim),并证明它可以精确复现任意实值向量内积,其表示规模同样仅与原始向量中的非零元素相关。这一扩展方案的性能至少不逊于任何单向量检索模型和任何基于MaxSim的检索模型。
我们还证明,MaxSim和有符号MaxSim可以表示标准内积在相同表示规模下无法复现的相似性,从而明确揭示了内积模型与延迟交互模型之间的表示能力差距。
相似文章
@Julian_a42f9a:后期交互检索模型的表示已超越检索本身,可直接用于RAG
新论文表明,后期交互检索模型的表示可替代原始文档文本,在RAG任务中拓展其应用边界。
@SilvioMartinico: 晚期交互多向量检索生态系统正在爆炸式发展。为了帮助区分信号与噪声……
一份精选的顶级模型、引擎、库和数据集的列表,用于晚期交互多向量检索,组织在'Awesome Multivector Retrieval'资源中。
@mixedbreadai: https://x.com/mixedbreadai/status/2071678747439505816
Mixedbread AI 引入了用于后期交互检索的非对称量化技术,通过将文档向量存储为二进制符号同时保持查询向量高精度,实现了32倍的存储缩减且质量损失极小,使得后期交互在十亿级生产系统中变得实用。
ColGraphRAG:多模态GraphRAG的延迟交互证据检索
ColGraphRAG 在多模态 GraphRAG 中使用延迟交互 MaxSim 评分替代单向量双编码器相似度,用于对图链接图像候选进行排序,从而提高了 MultimodalQA 上的检索和问答准确率。
@lateinteraction:对于某些晚期交互来说,永远都不会太晚——太酷了 @sirupsen @turbopuffer!
Turbopuffer 宣布对晚期交互(late interaction)的 beta 支持,使 ColBERT 等模型能够将文本表示为 token 级向量,将快速的单向量 ANN 初步搜索与精确的晚期交互重排序相结合,以提高召回率。