标签
Turbopuffer 宣布对晚期交互(late interaction)的 beta 支持,使 ColBERT 等模型能够将文本表示为 token 级向量,将快速的单向量 ANN 初步搜索与精确的晚期交互重排序相结合,以提高召回率。
本文介绍了完全开放的DenseOn和LateOn检索模型,这些模型在精心整理的英语数据上训练,并通过translate-train扩展到多语言设置,在其参数规模下实现了最先进的BEIR结果。
ColGraphRAG 在多模态 GraphRAG 中使用延迟交互 MaxSim 评分替代单向量双编码器相似度,用于对图链接图像候选进行排序,从而提高了 MultimodalQA 上的检索和问答准确率。
本文量化并扩展了晚期交互检索模型的理论容量,证明MaxSim可以复制非负向量之间的内积,并提出适用于任意实值向量的Signed MaxSim,揭示了内积模型与晚期交互模型之间的表示差距。
介绍了SaMer,一种面向对象的标记合并框架,用于压缩视觉-语言检索中的图像侧标记,同时保留对象级证据,显著减少存储并提升检索性能。
Mixedbread Search 引入了非对称量化用于后期交互检索,通过将文档向量存储为二进制符号,同时保持查询向量为更高精度,实现了近无损质量且存储减少97%。
Mixedbread AI 引入了用于后期交互检索的非对称量化技术,通过将文档向量存储为二进制符号同时保持查询向量高精度,实现了32倍的存储缩减且质量损失极小,使得后期交互在十亿级生产系统中变得实用。
Mixedbread宣布,用户现在可以自带云存储桶,从而通过延迟交互模型实现零保留索引和搜索。
TopK 推出了 semantic_index,这是一种单一的 schema 注解,抽象了生产系统中多向量检索的复杂性,实现了亚秒级延迟和高吞吐量的最先进性能。
PyLate的发布引入了MaxSim内核,用于GPU加速训练,内存需求更低;以及TACHIOM,用于在CPU上实现快速多向量索引和搜索。
Argus-Retriever 是一种新型的延迟交互视觉文档检索器,它根据查询自适应文档表示,在 ViDoRe 基准测试上以更小的索引实现了 SOTA 性能。
一份精选的顶级模型、引擎、库和数据集的列表,用于晚期交互多向量检索,组织在'Awesome Multivector Retrieval'资源中。
LateOn作为新一代ColBERT模型,在BEIR上相比v2提升了近10个百分点,并且在BEIR之外也表现出良好的泛化能力,同时在PyLate中的使用方法完全相同。
作者分享了他们通过将k-means用作top-1稀疏编码来降低多向量检索成本的工作。Omar Khattab补充说,在无监督稀疏自编码器上使用神经元级别倒排索引的晚期交互稀疏检索效果很好。
本文提出了一种使用无监督稀疏自编码器和自然倒排索引的单阶段稀疏编码方法,以加速多向量检索,其效果优于传统的基于k-means的方法。
ProtoCol将后期交互检索应用于蛋白质同源搜索,将蛋白质表示为残基嵌入集,并使用MaxSim进行评分,在远程同源基准上优于池化方法和基于比对的方法。
SMART是一个框架,能够解锁单向量模型中的潜在多向量能力,用于多模态检索,通过对比训练和后期交互推理,在降低计算成本的同时提升最先进的性能。
在 Hugging Face 上发布了一个内核,通过使用分块评分和 SIMD 组矩阵运算(Metal 和 WMMA)来加速 MaxSim 后期交互检索,比朴素实现获得了 3–5 倍的加速。
LightOn 使用一个 1.5 亿参数的后期交互模型,达到了 GPT-5 级别的深度研究检索性能,这是一项了不起的成就。
本文强调了 ColBERT 模型如何凭借延迟交互(late interaction)技术和极少微调,尽管体积更小且发布时间更早,仍优于 Qwen3-embed-8B 等更大规模的模型。